全部 未讀 (38850) ★ 收藏 (0) 🤖 人工智能 (14438) 📊 商业科技 (6797) 📁 媒体资讯 (5566) 📁 投资财经 (3455) 📁 生活文化 (2931) 💻 软件编程 (2066) 📁 个人成长 (1989) 📁 体育运动 (1017) 🎨 产品设计 (539) 📁 AI 产品 (39)
篩選中: 🏷️ ASR 共 17 篇 ✕ 清除篩選
38852
全部文章
38850
未讀
209
今日新增
0
收藏
📡 Poller 最後抓取: 2 小時前 (08-10 14:00)
BestBlogs 精選 (38778)

🏷️ 熱門標籤

AI Agent 3209 政策解读 1679 投资与市场 1463 宏观经济 1354 AI 编程 1344 产业动态 1302 国际新闻 1211 LLM 1167 Anthropic 1088 社会议题 1050 Claude Code 1041 国内新闻 1013 地缘政治 960 科技新闻 906 OpenAI 897 AI 智能体 788 生活方式 727 个人成长 690 开源 686 足球 685
使用 Qwen3 ASR 解决字幕翻译中的语音转文字问题
📌 一句话摘要 作者分享了 Whisper 在字幕翻译中的不足,并推荐本地运行的 Qwen3 ASR 配合 Qwen3-ForcedAligner 实现精准词级时间戳,同时介绍开源发言人识别方案和火山引擎豆包云端模型作为备选。 📝 详细摘要 最早使用 Whisper 进行语音转文字时遇到时间戳不
📅 2026-07-17 14:28 (24 天前) 宝玉 人工智能 1 分鐘 ★ 82
Qwen3 ASR 语音转文字 字幕翻译 Whisper 问题
有没有比 whisper large v3 更准更强的
📌 一句话摘要 V2EX 用户讨论 Whisper large v3 的准确性问题,多位用户反馈 v3 在中文和日文上不如 v2,并推荐了豆包、ElevenLabs 等替代方案。 📝 详细摘要 这是一篇 V2EX 论坛的问答帖,用户询问是否有比 Whisper large v3 更准更强的语音识
📅 2026-06-02 14:43 (06-02 14:43) wcwcxiaobin 人工智能 1 分鐘 ★ 78
Whisper 语音识别 ASR V2EX
TLiveOmni 1.0: 直播视频多模态理解大模型
📌 一句话摘要 TLiveOmni 1.0 是阿里巴巴大淘宝技术团队推出的面向电商直播场景的全模态大模型,原生支持图像、文本、视频、音频四模态统一输入,在语音识别、商品定位等任务上达到 SOTA 水平。 📝 详细摘要 本文详细介绍了由阿里巴巴大淘宝技术团队研发的 TLiveOmni 1.0 全模
📅 2026-05-20 16:26 (05-20 16:26) 大淘宝技术 人工智能 2 分鐘 ★ 90
全模态大模型 电商直播 TLiveOmni 多模态理解
目标说话人识别大模型,让车外语音“聚精会神”听懂你
📌 一句话摘要 小米技术团队提出 TS-ASR 大模型,通过引入思维链推理与强化学习,在车外语音场景中实现目标说话人精准识别与动态追踪,有效解决鸡尾酒会问题。 📝 详细摘要 本文由小米技术团队发布,详细介绍了其新一代车外语音交互系统的核心技术——目标说话人识别大模型(TS-ASR)。文章从实际痛
📅 2026-05-06 17:00 (05-06 17:00) 小米技术 人工智能 2 分鐘 ★ 85
TS-ASR 目标说话人识别 思维链 车外语音
微软 VibeVoice-ASR 语音识别模型实测:单模型搞定说话人分离与转写
📌 一句话摘要 微软开源的 9B 参数语音转文字模型 VibeVoice-ASR 在 Mac 上实测,单次处理 60 分钟音频,原生支持说话人分离,但本地运行需 64GB 以上内存。 📝 详细摘要 这条推文详细介绍了微软研究院今年 1 月开源的 VibeVoice-ASR 语音识别模型,并引用了
📅 2026-04-29 08:06 (04-29 08:06) 宝玉 人工智能 1 分鐘 ★ 87
VibeVoice-ASR 微软 语音识别 说话人分离
宝玉分享用户对 VibeVoice ASR 的测试反馈
📌 一句话摘要 宝玉转发了一位用户对 VibeVoice ASR 模型的负面测试反馈,指出其性能不如预期,且本地运行效果更好的方案是 pyannote + qwenASR。 📝 详细摘要 这条推文是宝玉对一条用户反馈的转发和评论。被引用的用户反馈指出,VibeVoice ASR 模型在实际测试中
📅 2026-04-29 08:33 (04-29 08:33) 宝玉 人工智能 1 分鐘 ★ 78
VibeVoice ASR 语音识别 Speaker Diarization
宝玉分享专业人士对 VibeVoice ASR 的深度点评
📌 一句话摘要 宝玉转发了一位专业人士(FeitengLi)对 VibeVoice ASR 模型的深度点评,内容涉及技术细节、行业八卦和未来趋势。 📝 详细摘要 这条推文是宝玉对 FeitengLi 一条长推文的转发和评论。FeitengLi 的推文对 VibeVoice ASR 模型进行了深度
📅 2026-04-29 09:02 (04-29 09:02) 宝玉 人工智能 1 分鐘 ★ 85
VibeVoice ASR 语音识别 Speaker Diarization
2 秒钟转写 5 分钟音频!国产新语音模型拿下多项 SOTA,定价骤减 90%
📌 一句话摘要 阶跃星辰发布 StepAudio 2.5 ASR 语音识别模型,通过 Multi-Token Prediction 技术实现推理速度提升 400%、成本下降 80%,定价仅为 0.15 元/小时,但在实测中部分音频上传场景识别失败。 📝 详细摘要 本文报道了阶跃星辰于 2026
📅 2026-04-24 19:59 (04-24 19:59) 智东西 人工智能 2 分鐘 ★ 82
阶跃星辰 StepAudio 语音识别 ASR
敢不敢用家乡话测试这个 AI?
📌 一句话摘要 通义实验室发布 Fun-ASR 1.5 语音识别大模型,实现了方言识别从‘听得清’到‘工业级可用’的突破,单模型覆盖 30 种语言及汉语七大方言体系,并优化了古诗词识别与文本规范化输出。 📝 详细摘要 文章介绍了通义实验室最新发布的 Fun-ASR 1.5 语音识别大模型。该模型
📅 2026-04-20 14:02 (04-20 14:02) 通义大模型 人工智能 2 分鐘 ★ 88
语音识别 方言识别 通义实验室 Fun-ASR
阿里通义实验室发布 Fun-ASR 1.5,支持 30 种语言及汉语七大方言
📌 一句话摘要 阿里通义实验室发布了 Fun-ASR 1.5 语音识别模型,该模型单模型即可覆盖 30 种语言、汉语七大方言及 20 多种地方口音,在方言识别准确率上相比上代有显著提升。 📝 详细摘要 这条推文介绍了阿里通义实验室最新发布的 Fun-ASR 1.5 语音识别模型。其核心亮点在于强
📅 2026-04-20 16:52 (04-20 16:52) AIGCLINK 人工智能 1 分鐘 ★ 82
Fun-ASR 语音识别 ASR 阿里通义实验室
Antirez 谈 Gemma 4 取代专用 ASR 的潜力
📌 一句话摘要 Antirez 预测,小型 Gemma 4 模型很可能会超越并取代专用的自动语音识别(ASR)模型。 📝 详细摘要 Redis 的创建者 Antirez 推测,最新的小型 Gemma 4 模型已经具备足够的能力,足以让专用的 ASR(自动语音识别)模型在转录任务中变得过时,这凸显
📅 2026-04-03 00:16 (04-03 00:16) antirez 人工智能 1 分鐘 ★ 78
Gemma 4 ASR LLM 语音识别
Cohere 的开放权重 ASR 模型实现 5.4% 的词错误率 —— 足以在生产流水线中替代语音 API
📌 一句话摘要 Cohere 发布了“Transcribe”,这是一个开放权重、生产级别的 ASR 模型,词错误率为 5.42%,旨在提供可与闭源 API 相媲美的企业级准确性和自托管能力。 📝 详细摘要 Cohere 推出的全新开放权重 ASR 模型 Transcribe,解决了企业在选择高准
📅 2026-03-31 01:00 (03-31 01:00) Emilia David 人工智能 10 分鐘 ★ 86
ASR 语音识别 Cohere 开放权重
实时 ASR 交互设计的微妙之处
📌 一句话摘要 作者在开发实时 ASR 交互时发现,不同场景下的交互逻辑存在微妙差异,AI 虽然能执行但难以进行这种人性化的设计。 📝 详细摘要 推文分享了作者在三个不同场景下进行实时 ASR 交互设计的实践心得。作者指出,交互设计在不同场景下具有高度的上下文依赖性和微妙感,这种细腻的「人感」是
📅 2026-03-28 18:33 (03-28 18:33) Orange AI 人工智能 1 分鐘 ★ 80
ASR 交互设计 AI 产品 用户体验
Cohere 发布开源 ASR 模型 Cohere Transcribe,刷新语音转录性能标杆
📌 一句话摘要 Cohere 开源了其高性能 ASR 模型「Cohere Transcribe」,在 Hugging Face 榜单上以 5.42% 的 WER 位居榜首,支持 14 种语言及生产级部署。 📝 详细摘要 该推文详细解读了 Cohere 最新开源的语音转录模型「Cohere Tra
📅 2026-03-26 22:45 (03-26 22:45) meng shao 人工智能 1 分鐘 ★ 86
Cohere ASR 语音识别 开源模型
ListenHub ASR 语音识别 API 正式上线
📌 一句话摘要 ListenHub 推出支持本地离线、无限免费的 ASR 语音识别 API,专为 AI Agent 自动化流设计。 📝 详细摘要 ListenHub 发布了全新的 ASR(语音识别)API,主打本地离线运行和完全免费。该工具采用双模型方案:默认使用 SenseVoice 支持中、
📅 2026-03-13 17:12 (03-13 17:12) Orange AI 人工智能 3 分鐘 ★ 82
ListenHub ASR 语音识别 AI Agent
ListenHub ASR:优于 Whisper 的免费中文语音识别工具
📌 一句话摘要 推荐一款支持中文效果出色且可无限量免费使用的 ASR 工具及其安装方法。 📝 详细摘要 推文推荐了由 Orange AI 团队出品的 ListenHub ASR 工具。作者指出其在中文识别效果上优于 OpenAI 的 Whisper,并提供了在 CC 平台上的具体安装指令。该工具
📅 2026-03-13 17:48 (03-13 17:48) 向阳乔木 人工智能 3 分鐘 ★ 85
ASR 语音识别 ListenHub 中文适配
NLE:通过文本编辑实现的非自回归 ASR
📌 一句话摘要 一种新型非自回归语音识别(ASR)方法,通过使用 LLM 编辑转录文本来工作。 📝 详细摘要 NLE(基于 LLM 文本编辑的非自回归 ASR)提出了自动语音识别领域的一种范式转变。它不再使用传统的自回归解码,而是利用 LLM 通过迭代编辑和优化转录文本,来执行非自回归 ASR,
📅 2026-03-10 23:43 (03-10 23:43) AK 人工智能 1 分鐘 ★ 80
ASR 语音识别 非自回归 LLM