小米技术团队提出 TS-ASR 大模型,通过引入思维链推理与强化学习,在车外语音场景中实现目标说话人精准识别与动态追踪,有效解决鸡尾酒会问题。
📝 详细摘要
本文由小米技术团队发布,详细介绍了其新一代车外语音交互系统的核心技术——目标说话人识别大模型(TS-ASR)。文章从实际痛点出发,指出传统车外语音方案在多人同时说话、用户移动等复杂场景下容易误触发或识别不完整,本质是鸡尾酒会问题。核心突破在于将思维链推理引入语音识别任务,让模型在输出指令文本前先进行逻辑推理,分析说话人数量、重叠语音、目标声纹等信息,实现先思考再识别。技术架构基于 Data2Vec2 语音编码器和轻量级 LLM,采用三阶段训练策略:全参数监督微调建立基础能力、CoT 微调教会模型推理、GRPO 强化学习攻克难样本。实验数据显示,CoT 推理将 2 人混音错误率从 7.4% 降至 5.29%,加入强化学习后进一步降至 4.84%。此外,文章还介绍了移动拾音功能(TS-Tracking),实现动态追踪车主声音,与 TS-ASR 形成完整配合,提升车外语音交互的稳定性和连续性。
💡 主要观点
- 引入思维链推理,让模型先分析场景再识别指令。 模型在输出转录文本前,先推理说话人数量、重叠语音、目标声纹等结构化信息,实现先思考再识别,显著提升复杂场景下的识别准确率。
💬 文章金句
- 不是直接输出识别结果,而是让模型先思考,再决定该听谁、该输出什么。
- CoT 推理将 2 人混音错误率从 7.4% 降至 5.29%,提升约 28%——证明'先思考'确实有效。
- 相似度我们没有直接使用浮点数(如 0.87),而是映射成 1-5 的离散等级。实验证明,大模型更容易理解简洁的符号。
- 从'听到什么转什么'到'只听你说的',这不只是技术指标的提升,更是车外语音交互体验的一次质变。
📊 文章信息
AI 初评:85
来源:小米技术
作者:小米技术
分类:人工智能
语言:中文
阅读时间:12 分钟
字数:2835
标签: TS-ASR, 目标说话人识别, 思维链, 车外语音, 鸡尾酒会问题