端到端实时语音,可打断
点击「开始通话」,授权麦克风后直接开口说话
说话时机器人会实时用语音回复,可随时打断它
Qwen-Audio 使用阿里云百炼 qwen-audio-3.0-realtime-plus,人设用上方通用「人设 / 系统提示」,模型由后端配置固定。已内置 run_codex 工具(可让它写代码/跑脚本/查项目)。该模型为纯音频,不支持摄像头视觉。
QwebO 使用阿里云百炼 qwen3.5-omni-plus-realtime(全模态:音频+视觉),人设用上方通用「人设 / 系统提示」,模型由后端配置固定。已内置 run_codex(写代码/跑脚本/查项目);开启摄像头后再加 capture_camera——模型判断需要看画面时主动拍照。因阿里实时协议限制(自动断句模式下不能单独提交图像),拍照后画面会在你「下一句话」时一并送达模型,所以调用后再说一句(如「看到了吗」)它就能看图作答。
修改后需重新点「开始通话」才生效。设置保存在浏览器本地。摄像头首次使用会请求授权。人设两家通用,音色各自独立;模型/温度/打断/摄像头为 Gemini 专属。