← 回總覽

微软 VibeVoice-ASR 语音识别模型实测:单模型搞定说话人分离与转写

📅 2026-04-29 08:06 宝玉 人工智能 1 分鐘 800 字 評分: 87
VibeVoice-ASR 微软 语音识别 说话人分离 开源模型
📌 一句话摘要 微软开源的 9B 参数语音转文字模型 VibeVoice-ASR 在 Mac 上实测,单次处理 60 分钟音频,原生支持说话人分离,但本地运行需 64GB 以上内存。 📝 详细摘要 这条推文详细介绍了微软研究院今年 1 月开源的 VibeVoice-ASR 语音识别模型,并引用了 Simon Willison 在 Mac 上的实测报告。该模型最大亮点是单次能处理 60 分钟连续音频,并原生支持说话人分离(谁在说、什么时候说、说了什么),无需像传统方案那样拼接 Whisper 和 pyannote 等工具。实测使用 4-bit 量化版(5.71GB),在 128GB 内存的

📌 一句话摘要

微软开源的 9B 参数语音转文字模型 VibeVoice-ASR 在 Mac 上实测,单次处理 60 分钟音频,原生支持说话人分离,但本地运行需 64GB 以上内存。

📝 详细摘要

这条推文详细介绍了微软研究院今年 1 月开源的 VibeVoice-ASR 语音识别模型,并引用了 Simon Willison 在 Mac 上的实测报告。该模型最大亮点是单次能处理 60 分钟连续音频,并原生支持说话人分离(谁在说、什么时候说、说了什么),无需像传统方案那样拼接 Whisper 和 pyannote 等工具。实测使用 4-bit 量化版(5.71GB),在 128GB 内存的 M5 Max MacBook Pro 上,转写一小时播客耗时 8 分 45 秒,但 prefill 阶段内存峰值高达 61.5GB,普通 32GB 笔电无法运行。模型还识别出三个说话人(实际只有两人),因不同录音环境导致。硬限制包括单次最多 60 分钟和至少 64GB 内存需求。对播客转写、会议纪要、采访整理等场景有实用价值。

📊 文章信息

AI 初评:87

来源:宝玉(@dotey)

作者:宝玉

分类:人工智能

语言:中文

阅读时间:3 分钟

字数:732

标签: VibeVoice-ASR, 微软, 语音识别, 说话人分离, 开源模型

阅读推文

查看原文 → 發佈: 2026-04-29 08:06:25 收錄: 2026-04-29 10:00:01

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。