阿里千问近日宣布对其语音技术栈进行全面升级,推出Qwen-Audio-3.1系列五款新模型,构建起覆盖语音识别、合成、实时交互及音频创作与理解的完整能力矩阵。此次更新不仅在技术层面实现突破,更通过大幅降价策略降低使用门槛,推动语音技术向更广泛的场景渗透。
在语音识别领域,Qwen-Audio-3.1-ASR模型展现出显著优势。其核心创新在于“上下文感知”能力,通过原生转写润色技术自动过滤语气词、修正重复表达,并重组语义逻辑,使输出文本更符合人类阅读习惯。分角色转写功能可精准还原对话场景,通过联合输出说话人标签、时间戳和文本内容,实现多人对话的完整结构化记录。该模型支持30种语言及16种中文方言,在方言识别任务中表现突出,温州话等复杂方言的语义准确率达82.10%,公开数据集测试平均字错误率低至4.55%。
基于下一代架构的Qwen-Audio-3.1-ASR-Next进一步拓展识别边界,将分析对象从单纯语音扩展至完整音频信息。该模型可识别人物情绪、环境声及机械声,完成声音描述、事件定位及音频问答推理。例如,在混合对话、背景音乐和环境噪音的音频中,它能同时输出字幕、声音类型列表及事件时间轴,并回答关于整体内容的提问。测试数据显示,其在分角色识别任务中八项指标全面领先传统级联系统。
语音合成方面,Qwen-Audio-3.1-TTS模型突破传统“字音准确”的局限,强调情感表达与场景适配。通过多语种音色迁移技术,同一音色可自然切换多种语言,并支持通过指令动态调整情绪、语速和表达方式。下一代版本Qwen-Audio-3.1-TTS-Next则实现质的飞跃,将音频创作从“人声合成”升级为“通用音频生成系统”。该模型可统一生成人声、音效及环境音,支持多人音色复刻与多轮对话,在连续内容中保持角色音色一致性。其多模态控制能力允许用户通过自然语言指定语气、音量及音乐风格,满足有声书、影视配音等复杂场景需求。
实时交互领域,Qwen-Audio-3.1-Realtime模型采用全双工架构,实现“边听边说”的无缝对话体验。系统可实时感知用户情绪与意图,动态调整回应策略——当检测到低落语气时,会自动放慢语速并优化措辞;在语言切换场景中保持上下文连贯性。该模型通过多教师蒸馏技术平衡低延迟与高安全性,并支持在对话中直接调用外部工具,将API查询、知识库检索等结果自然融入交互流程。目前,该技术已与Qoder办公助手、千问AI眼镜等硬件设备深度整合,用户可通过语音直接发起任务或修改需求。
价格策略成为此次升级的另一焦点。阿里千问将TTS服务价格下调约70%,Realtime交互成本降低85%,ASR识别费用更是削减95%。这一举措显著降低企业及开发者应用语音技术的门槛,加速技术在教育、医疗、娱乐等领域的落地。从方言识别到情绪感知,从多语言合成到完整音频创作,Qwen-Audio-3.1系列通过五条并行技术路径,将语音交互打造为连接人类、内容与AI的核心入口。






