BA nana (@Henry_He)人和模型如何共享媒介 中发帖

GPT 现在的多模态能力已经很强,随手一张截图贴进对话框就能代替大段的文字描述 
但对模型而言,一张截图往往意味着几百甚至数千视觉 token ,其中包含大量和任务无关的颜色、样式和像素,使用非常方便,但在长程、工业级场景下会成为推理负担,以 OpenAI 一张 1920 × 1080 截图为例: 




模型与模式
处理方式
约占




GPT-5.6 low
缩放到 512×288,再按 32px patch 计算
173 tokens


GPT-5.6 high
60×34 个 32px patches,再乘 1.2
2,448 tokens




如果代码报错时面对几百行报错日志,你会: 
1.截图甩给模型 
2.复制原本文本给模型 
3.自己修复 
没有理由不选 2,截图反而要求模型额外处理颜色、边框、排版等与问题无关的噪声 

一种理想的多模态交互模式是让图片成为持续对...
 
 
Back to Top