BA nana (@Henry_He) 在 人和模型如何共享媒介 中发帖
GPT 现在的多模态能力已经很强,随手一张截图贴进对话框就能代替大段的文字描述
但对模型而言,一张截图往往意味着几百甚至数千视觉 token ,其中包含大量和任务无关的颜色、样式和像素,使用非常方便,但在长程、工业级场景下会成为推理负担,以 OpenAI 一张 1920 × 1080 截图为例:
模型与模式
处理方式
约占
GPT-5.6 low
缩放到 512×288,再按 32px patch 计算
173 tokens
GPT-5.6 high
60×34 个 32px patches,再乘 1.2
2,448 tokens
如果代码报错时面对几百行报错日志,你会:
1.截图甩给模型
2.复制原本文本给模型
3.自己修复
没有理由不选 2,截图反而要求模型额外处理颜色、边框、排版等与问题无关的噪声
一种理想的多模态交互模式是让图片成为持续对...