@Yohji1 在 如何让现在的模型处理超长的文本? 中发帖

有客户找我,要求是需要我做一个SKILL。 
他提供了11份pdf以及一个Gemini网页端的会话记录,约40多万字。 
这么大的体量,如何让模型消化——理解——提炼?这是不是有点难以做到? 
我的现有思路是: 
1.针对两种不同性质的文本做不同要求的量化评价标准 
2.开子代理做上下文隔离,分批次处理文本 
3.子代理产出符合评价标准的文档,这一步只做消化理解,不做提炼 
4.将子代理产出的内容交给主会话模型,基于我的上下文背景要求去做提炼总结 
我遇到的问题: 
1.不同的pdf之间存在关联,如果开子代理的情况下,会出现隔断 
2.Gemini的那个会话是长期使用的产出,时间跨度太长,模型分析起来十分困难啊 
3.我担心最终的SKILL产出仍然是不小的体量,导致最终应用起来时,对模型的上下文负担太大,但太过于浓缩的话,又不好保证效果 
4.处理文本前的评价标准都不好定
 
 
Back to Top