Flash News

英伟达发布PersonaPlex:全双工语音模型,可同时听与说,实现自然对话

英伟达研究团队推出开源PersonaPlex-7B-v1全双工语音对话模型,基于Moshi架构,首次实现AI同时听用户说话并生成响应,支持自然打断、后反馈(如“呃哼”)、重叠对话和快速轮换,无需传统ASR→LLM→TTS级联延迟。

核心创新
单一Transformer模型处理连续24kHz音频令牌,双流架构并行生成文本与语音;混合提示(语音提示定音色/韵律、文本提示定角色/背景)实现高保真克隆与个性对话。

训练融合合成数据(39k教学助理对话+105k客服场景,2250小时)和真实Fisher对话,解耦语音自然度与任务遵守,支持情感表达/语速控制。

实际意义
消除“听-想-说”延迟,模拟人类中断/自纠;企业级语音代理(如客服/教育)从机械转向流畅,Hugging Face开源,优于商用模型对话自然度。

来源:公开信息

Nvidia

Source

·ABAB News
·
1 min read
·177d ago
分享: