Mozi (@yeahhe) 在 字幕提取这个领域,Gemini 还是太超模了 中发帖

好久没有测试 Gemini 提取字幕的能力了,对 3.8 Flash 这个模型也进行测试 
视频时长11分半,不对视频进行切片,一次性导入上下文,多模态分析 
第一次 API 调用完成字幕提取 
测试一:音频转字幕 
拖入音频文件,获取字幕 
 [PixPin_2026-09-29_01-30-21] 
 [PixPin_2026-09-29_01-36-54] 
镜头这个位置是AI识别出的字幕 
完成该操作时使用了17K的输入和8K的输出 
只调用一次API 
所有时间戳均准确无误 
[PixPin_2026-09-29_01-33-13] 
唯一缺点是该专有品牌采用了中文名称,这个中文名在互联网上均无法查询到 
[PixPin_2026-09-29_01-51-37] 
 [PixPin_2026-09-29_01-52-16] 
 [PixPin_2026-09-29_01-51-3...
 
 
Back to Top