微软开源的 9B 参数语音转文字模型 VibeVoice-ASR 在 Mac 上实测,单次处理 60 分钟音频,原生支持说话人分离,但本地运行需 64GB 以上内存。
📝 详细摘要
这条推文详细介绍了微软研究院今年 1 月开源的 VibeVoice-ASR 语音识别模型,并引用了 Simon Willison 在 Mac 上的实测报告。该模型最大亮点是单次能处理 60 分钟连续音频,并原生支持说话人分离(谁在说、什么时候说、说了什么),无需像传统方案那样拼接 Whisper 和 pyannote 等工具。实测使用 4-bit 量化版(5.71GB),在 128GB 内存的 M5 Max MacBook Pro 上,转写一小时播客耗时 8 分 45 秒,但 prefill 阶段内存峰值高达 61.5GB,普通 32GB 笔电无法运行。模型还识别出三个说话人(实际只有两人),因不同录音环境导致。硬限制包括单次最多 60 分钟和至少 64GB 内存需求。对播客转写、会议纪要、采访整理等场景有实用价值。
📊 文章信息
AI 初评:87
来源:宝玉(@dotey)
作者:宝玉
分类:人工智能
语言:中文
阅读时间:3 分钟
字数:732
标签: VibeVoice-ASR, 微软, 语音识别, 说话人分离, 开源模型