← 回總覽

同声传译一夜失业!GPT-Live 瞬间翻译,老太太现场抬杠 AI 看傻全网

📅 2026-07-09 09:54 Jay 人工智能 3 分鐘 3359 字 評分: 82
AI 语音 GPT‑Live OpenAI 语音交互 技术评测
📌 一句话摘要 文章介绍 OpenAI 发布的 GPT‑Live 语音模式,实现实时翻译、自然对话和可视化反馈,并指出其优势与不足。 📝 详细摘要 文章详细描述了 OpenAI 最新发布的 GPT‑Live 语音交互功能,包括全双工实时翻译、分层推理模式(Instant/Medium/High)、可视化卡片与联网搜索等新特性。通过实际演示和用户反馈,文章指出该模式在对话流畅度和信息有效性上有显著提升,但仍存在一定的回合感和偶尔过早打断的问题,整体呈现客观的技术评测。 💡 主要观点 实现真正的全双工实时翻译 GPT‑Live 能在说话时同步理解并输出翻译,延迟极低,实现无缝双向交流。 引入

82

The article introduces OpenAI's newly released GPT‑Live voice mode, which enables real‑time translation, natural conversation, and visual feedback, while also highlighting its strengths and weaknesses. 量 量子位

Today 2156 words (about 9 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

> Jay 发自 凹非寺 > > > 量子位 | 公众号 QbitAI

同声传译,这下可能是真寄了啊……

刚刚,OpenAI发布了GPT-Live,语音交互迎来了一次质的飞跃。

真·一句话说完,瞬间翻译。

俩老太太也是角色扮演上了。

这效果,说实话,比去年AirPods Pro 3宣传片里画的饼强太多了。

Apple Intelligence你慢慢上线吧,我等OpenAI自己出硬件了(doge)。

更重要的是推理+搜索能力的提升。

老太太把GPT当Google使,一会儿问天气,一会儿考历史,你来我往跟抬杠大赛似的。

而且全是有效信息,AI终于不再用一堆车轱辘话敷衍你了。

除此之外,官方还一次性放出了一堆demo。 厨房场景:不用再对着空气大喊Siri了。GPT可以边一步步指导你烹饪,边帮你计时,真正解放双手。 面试复盘:智能水平大幅提升,AI帮你复盘面试表现,甚至现场教你如何谈薪资。

甚至,OpenAI昨晚还开了一场直播进行现场演示,也是很自信了。。。

感兴趣的可以到官网查看更多demo。

!Image 1

OpenAI透露,每周有1.5亿人在和ChatGPT对话。而现在,你手机上的那个白色软件,要变成可随时煲电话粥的「真人」了。 真·美国版豆包(bushi)。

总结一下,新的语音模式主要有三点改进。 1、更自然的对话。

以前和AI语音聊天,最怕的就是「抢麦」。现在,你可以随时插话、停下来思考。

当你说话时,它还会时不时发出「嗯、对」这种简短的回应,让你知道它在听。

在抗噪方面也做了优化,面对马路上的车流声或旁边的闲聊,它能更精准地聚焦你的声音。

但关于这一点,评论区有不同声音,不少网友表示,虽然更流畅了,但也老是装作「松弛」地打断用户。

可能还是需要视觉信息吧,毕竟即便是人在开腾讯会议时,也会经常出现互相打断的情况,微表情还是很重要的上下文。

对了,「声优」们也升级了,OpenAI这次特意为GPT-Live重新打磨了ChatGPT里的9种默认音色。 2、更聪明的回答。

以前的语音模式,往往调用的是相对较弱的模型,但这次,ChatGPT Voice接入了GPT-5.5。

还支持自定义推理强度:

* Instant:适合查天气、闲聊等快问快答,主打秒回。 * Medium / High:适合需要深度思考的复杂问题。 3、可视化对话。

边听边看,体验拉满。

在语音对话中,ChatGPT 可以实时弹出天气、股票、体育赛事等主题的可视化卡片,不用你再切回屏幕去干看文字。

此外,语音通话现在全面支持联网搜索、记忆功能、图片识别和文件上传。

这意味着,语音不再是一个独立的「阉割模式」,而是正式成为了ChatGPT全套能力的统一交互入口。

如果你用过之前的ChatGPT语音模式,大概率会有这种感觉:

刚上手很惊艳,用久了就发现——完全是鸡肋啊!!

你说一句,它顿一下再回你;你再说,它再回。永远有一种回合感。还特别喜欢反问,动不动就「还有什么我可以帮你的吗?」

为什么会这样?

最早期的ChatGPT Voice,本质上是三个模型在接力跑:

1、先把你的语音转成文字(ASR)

2、再把文字喂给大语言模型生成回复(LLM)

3、最后把文字转成语音读出来(TTS)

三个模型串联,每一步都有延迟,每一步都在丢信息。你说话时的语气、停顿、情绪,在第一关语音转文字时就被抹平了。

上下文不够,自然会有问题。

后来OpenAI搞了Advanced Voice Mode,把音频处理和音频生成塞进了同一个模型里,做成端到端,延迟确实降了不少,对话也顺滑了一些。

但它骨子里还是「轮次式」的。通过检测「沉默」来判断你是不是讲完了。所以你稍微停顿想个词,或者旁边有人咳了一声,它就可能觉得「好,轮到我发言了」,直接抢麦。

GPT-Live这次在两个地方动了刀子。 1、全双工架构:边说边听

在说话的同时,还在听你在说什么。

GPT-Live不再只处理一个个分开的消息序列,而是在生成输出的同时持续处理输入。因此,模型可以在一秒内多次判断互动策略。

这让对话终于有了真正的「来回感」,时间感知更精准,也天然支持了实时翻译等需要极低延迟的场景。 2、深度任务委托:前台陪聊,后台干活

本质上就是个路由。

GPT-Live 负责前台的连续语音交互,保持对话流畅不卡顿;

但当你问的问题需要联网搜索、深度推理或更复杂的代理能力时,它会悄悄把任务委托给GPT-5.5这样的重型模型在后台处理。

这样一来,即使后台正在处理多个复杂任务,前台的语音对话也完全不会中断。

最终效果在Benchmark上也有体现。

OpenAI专门为GPT-Live建立了一套新的人工评测体系,核心就衡量两个指标:愉悦感和对话丝滑程度。

!Image 2

结果显示,在「像不像真人聊天」这件事上,GPT-Live确实做的不错。

至于推理和搜索能力,则更是薄纱之前的AVM了。尤其是Agentic Search这一块,官方数据说直接提升了100倍……

!Image 3

其他细节就不展开了,数据大家看看就行,Demo才是最有说服力的。

!Image 4

《Her》里的那个场景,可能比所有人想象的要来得更快。

从键盘到鼠标,从触屏到语音助手,每一次交互方式的改变,都重新定义了什么是「用电脑」。

但之前的语音交互,说到底还是命令式的。你跟Siri说「设个闹钟」「放首歌」,是在对机器下指令。

GPT-Live让我第一次觉得,跟AI说话这件事,从「使用工具」变成了「跟一个人交流」。 未来,你手机右下角那个语音通话按钮,可能会变成你最常用的入口。

参考链接:

[1]https://openai.com/index/introducing-gpt-live/

查看原文 → 發佈: 2026-07-09 09:54:44 收錄: 2026-07-09 20:00:29

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。