← 回總覽

目标说话人识别大模型,让车外语音“聚精会神”听懂你

📅 2026-05-06 17:00 小米技术 人工智能 2 分鐘 1417 字 評分: 85
TS-ASR 目标说话人识别 思维链 车外语音 鸡尾酒会问题
📌 一句话摘要 小米技术团队提出 TS-ASR 大模型,通过引入思维链推理与强化学习,在车外语音场景中实现目标说话人精准识别与动态追踪,有效解决鸡尾酒会问题。 📝 详细摘要 本文由小米技术团队发布,详细介绍了其新一代车外语音交互系统的核心技术——目标说话人识别大模型(TS-ASR)。文章从实际痛点出发,指出传统车外语音方案在多人同时说话、用户移动等复杂场景下容易误触发或识别不完整,本质是鸡尾酒会问题。核心突破在于将思维链推理引入语音识别任务,让模型在输出指令文本前先进行逻辑推理,分析说话人数量、重叠语音、目标声纹等信息,实现先思考再识别。技术架构基于 Data2Vec2 语音编码器和轻量级

📌 一句话摘要

小米技术团队提出 TS-ASR 大模型,通过引入思维链推理与强化学习,在车外语音场景中实现目标说话人精准识别与动态追踪,有效解决鸡尾酒会问题。

📝 详细摘要

本文由小米技术团队发布,详细介绍了其新一代车外语音交互系统的核心技术——目标说话人识别大模型(TS-ASR)。文章从实际痛点出发,指出传统车外语音方案在多人同时说话、用户移动等复杂场景下容易误触发或识别不完整,本质是鸡尾酒会问题。核心突破在于将思维链推理引入语音识别任务,让模型在输出指令文本前先进行逻辑推理,分析说话人数量、重叠语音、目标声纹等信息,实现先思考再识别。技术架构基于 Data2Vec2 语音编码器和轻量级 LLM,采用三阶段训练策略:全参数监督微调建立基础能力、CoT 微调教会模型推理、GRPO 强化学习攻克难样本。实验数据显示,CoT 推理将 2 人混音错误率从 7.4% 降至 5.29%,加入强化学习后进一步降至 4.84%。此外,文章还介绍了移动拾音功能(TS-Tracking),实现动态追踪车主声音,与 TS-ASR 形成完整配合,提升车外语音交互的稳定性和连续性。

💡 主要观点

- 引入思维链推理,让模型先分析场景再识别指令。 模型在输出转录文本前,先推理说话人数量、重叠语音、目标声纹等结构化信息,实现先思考再识别,显著提升复杂场景下的识别准确率。

三阶段训练策略:基础微调、CoT 微调、强化学习。 第一阶段全参数微调建立基础 TS-ASR 能力;第二阶段用结构化 CoT 数据集教会模型推理,其中相似度映射为离散等级(1-5)更符合大模型理解;第三阶段用 GRPO 强化学习针对难样本优化。
TS-ASR 与 TS-Tracking 协同,实现动态追踪与精准识别。 移动拾音功能动态追踪车主声源位置,TS-ASR 锁定目标声纹并进行 CoT 推理,两者配合实现站着说、走着说、嘈杂环境中都能精准识别。

💬 文章金句

- 不是直接输出识别结果,而是让模型先思考,再决定该听谁、该输出什么。

  • CoT 推理将 2 人混音错误率从 7.4% 降至 5.29%,提升约 28%——证明'先思考'确实有效。
  • 相似度我们没有直接使用浮点数(如 0.87),而是映射成 1-5 的离散等级。实验证明,大模型更容易理解简洁的符号。
  • 从'听到什么转什么'到'只听你说的',这不只是技术指标的提升,更是车外语音交互体验的一次质变。

📊 文章信息

AI 初评:85

来源:小米技术

作者:小米技术

分类:人工智能

语言:中文

阅读时间:12 分钟

字数:2835

标签: TS-ASR, 目标说话人识别, 思维链, 车外语音, 鸡尾酒会问题

阅读完整文章

查看原文 → 發佈: 2026-05-06 17:00:00 收錄: 2026-05-06 22:00:29

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。