Topic Timeline
#实时交互
这个主题在过往早报中的出现记录。深度条目直达研究报告,其余条目回到当日 edition。
- 开源更新2026-08-04 · 周二重要度 3/5
Qwen Audio Agent发布v1.3.0语音前端更新
QwenAudio 在 GitHub 于 8 月 3 日发布 qwen-audio-agent v1.3.0。这是一项实时语音 Agent 运行时的版本更新;变更应以 Release 与仓库文档为准,不能把它表述为新基础模型发布。
- 语音智能体的竞争开始从模型能否说话转向前端会话、打断处理和工具执行如何连续衔接。
- 此次版本更新的产品影响取决于兼容性、延迟和实际部署文档,而非仓库总星数。
- 工程更新2026-08-03 · 周一重要度 3/5深度报告 →
Qwen Audio Agent合入语音前端,v1.3.0仍在测试
Qwen Audio Agent于北京时间8月2日合入speech-to-speech实时前端,并补齐桌面端集成。仓库明确该能力仅可从源码体验,包版本仍为1.2.0。
- 新增量是前台语音提供者可按会话切换,并处理协议、打断和音频率差异。
- 正式版尚未发布,稳定性与跨平台体验仍需等待v1.3.0验证。
- 研究论文2026-07-11 · 周六重要度 4/5深度报告 →
待验证|Vidu S1:实时语音控制把视频生成推向交互模式
Vidu S1 进入 Hugging Face Papers;论文称可用语音实时控制数字角色,42 FPS 仍属团队自测口径。
- 这条线索的意义不是又一个视频模型,而是交互范式变化。
- 视频生成从离线 prompt 出片,转向可持续、可打断、可语音控制的 live session。