@shopkeeper 在 求问怎么实现实时语音对话功能 中发帖
经过几天的捣鼓,现在也是比较好地实现了家里的codex远程控制手机的能力,接下来我想更进一步,去达成我想实现贾维斯式交互的想法(类似于我能够在手机上跟它进行实时对话、委派任务,它能够调用我的所有资源去实现任务。目前给了它3台vps,1台windows电脑,1台手机。)。
但是目前实时语音服务,以及语音模型怎么跟codex和antigravity进行任务交接的问题还没有什么头绪,我想的是像gpt voice那样的交互体验,有佬友做过类似的项目吗?
目前跟gpt商讨的架构是这样的,不知道是否可行:
[image]
下面分享一下我今早在地铁上通过远程控制让gpt帮我生成图片的一个效果:
[image]
[image]
[image]