科技·商业·财经

阿里千问Qwen3.8-LiveTranslate同声传译模型革新:多语言支持,听感自然更流畅

   时间:2026-09-20 10:03 作者:江紫萱

阿里千问近日发布全新同声传译大模型Qwen3.8-LiveTranslate,通过创新架构实现翻译质量与响应速度的双重突破。该模型采用Interleave架构重构实时同传流程,在保持高准确率的同时,将字均延迟(LAAL)从2.8秒压缩至2.3秒。这一改进在需要毫秒级响应的会议场景中尤为关键,0.5秒的延迟优化显著提升了语音输出的自然流畅度,有效解决了传统同传中"跟不上语速"的痛点。

在基础能力方面,新模型支持60种语言的实时互译,并新增三大核心功能:其一,通过实时说话人分离技术,系统能精准识别不同发言者,配合增强的音色复刻能力,确保翻译后的语音保持原始说话人的声纹特征;其二,创新推出双语同屏显示功能,原文与译文在相同时间轴上同步呈现,方便听众进行内容核对;其三,引入长上下文消歧机制,模型可结合前文语境理解当前内容,使人名、专业术语等易错内容的翻译准确率提升显著。

技术架构上,该模型采用基于Hybrid MoE的Thinker-Talker双模块设计。Thinker模块负责多模态信息处理,将视频、音频、文本等输入按时间序列编排成因果链,实现"理解-翻译"的端到端处理;Talker模块则承担语音合成任务,通过分析源音频特征,生成保留原始音色的翻译语音。这种架构设计使模型能够同时处理多种输入信号,在保持语义准确性的同时,确保语音输出的情感表现力。

在专业评测中,Qwen3.8-LiveTranslate展现强劲实力。在Omnilingua-MSpeaker多说话人长音频评测集上,该模型在翻译忠实度、流畅度、简洁度及说话人分离错误率四个维度全面超越行业主流系统;在FLEURS测试集覆盖的70个语言方向中,其翻译质量、延迟控制、语音识别准确率及语音合成质量四项指标均领先上一代产品及同类系统。目前,该模型已开放个人体验入口与商业API接口,标志着同声传译从专业领域向大众应用的转型迈出关键一步。

 
 
更多>同类内容
全站最新
热门内容