一打七桑 (@amatelasi)关于瞎子deepseek模型的理解图片方法 中发帖

这边是对接了glm-4v-flash的免费图片识别模型 让其分析图片 
具体方法: 
让deepseek一次性发出11个图片识别请求 以像素级模式分别从文本 整体 各方面等方式直接并发传给glm让其分析(因为glm-4v-flash一次性不允许输入太多字符) 整合到一起 让deepseek不用多模态也能精准的识别图片内容 
当然 因为deepseek-flash前端能力不是太好 写出来的ui不好看 因为我还定了一条规矩 把UI传给glm给建议 然后ds再改任意轮次 
各位可以让自己的ai模型实现这样的效果 接上mcp 再在提示词里加上看图必须用此mcp 当然 你对UI有见解可以再加上每次对UI进行变动的时候也需要用mcp的UI分析模式
 
 
Back to Top