欣欣|林可欣 (@StellaFortuna)现在gpt的语音聊天模型是多元一体,还是纯粹tts音频?|语音聊天 靠的是提示词还是训练 中发帖

也就是说他是由语音识别模型,识别用户的话,转成文字,发给文本模型,然后再通过tts模型将文本转化成语音, 
还是说直接全模态处理一切信息,直接理解用户说了什么,并且将它转化为字幕 同时,直接输出音频,并将自己的音频也转化成字幕(当然转换成字幕这一步也有可能是语音识别模型做的 或者AI的那一边可能是语音识别模型自己主动做的) 
无论如何,今天玩上一个Plus 
好陌生的词,我好像是第一次玩Plus 🤔 
懒得翻设置,也懒得聊天了,打算以后留作改网站的备用 
因为新登录,所以自然而然又给我推了一下新的voice,然后就去体验了一下 
智能程度开的是中等 
没有看到思考过程 
但是聊天过程中呢,他的说话速度和他的文本输出速度基本是一致的,这一点非常有趣 
也令我思考 
这就真的是他的文本输出速度吗?还是说他已经提前写好了文本 只是逐渐显示出来? 
但最终 一个最重要的问题是 
为什么可以制造出类...
 
 
Back to Top