← 回總覽

全球办公 AI 王座易主!GPT-5.6 接管微软全家桶,数亿打工人集体换脑

📅 2026-07-11 12:30 新智元 人工智能 7 分鐘 8161 字 評分: 86
AI 大模型 办公 AI 成本效益 编码代理 移动 Agent
📌 一句话摘要 文章报道 OpenAI 的 GPT-5.6 被微软选为 365 Copilot 首选模型,并在编码基准和移动 Agent 上展现显著成本优势,标志着办公 AI 竞争转向‘每个 Token 更值钱’的性价比竞赛。 📝 详细摘要 文章详细报道了 OpenAI 宣布 GPT-5.6 成为微软 365 Copilot 的首选模型,全面进驻 Word、Excel、PowerPoint、Copilot Chat 和 Cowork,意味着数亿办公用户将切换使用该模型。随后通过 DeepSWE 编码基准测试展示了 GPT-5.6 Sol 在 73% 解决率下仅需约 8.4 美元/任务的成本

Title: 全球办公 AI 王座易主!GPT-5.6 接管微软全家桶,数亿打工人集体换脑 | BestBlogs.dev

URL Source: https://www.bestblogs.dev/article/14f4ad3547?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item

Published Time: 2026-07-11 12:30:00

Markdown Content: 86

The article reports that OpenAI's GPT-5.6 has been selected by Microsoft as the preferred model for 365 Copilot, demonstrating significant cost advantages in coding benchmarks and mobile agents, marking a shift in office AI competition toward a 'more value per token' cost-effectiveness race. ![Image 1: 新智元新智元](https://www.bestblogs.dev/articles?sourceid=1d8c20 "View More From This Source")

Today 2097 words (about 9 min) View Source →

Sign in to highlight text and take notes as you read. Sign in now

ASI启示录 2026-07-11 12:30 北京

!Image 2

!Image 3

新智元报道

!Image 4

##### 【新智元导读】GPT-5.6接管微软全家桶、编码屠榜成本仅Claude四成、Agent塞进手机,OpenAI一夜三城坐上办公AI王座。

办公AI,换王了。

就在刚刚,OpenAI一口气甩出三张牌,张张打在要害。

第一张:GPT-5.6成为微软365 Copilot的「首选模型」,全面进驻Word、Excel、PowerPoint、Copilot Chat和Cowork。

数亿打工人每天打开的那几个窗口,集体换脑。

!Image 5

第二张:编码代理基准DeepSWE跑分出炉——GPT-5.6 Sol解决率73%,单任务成本约8.4美元;Claude Fable 5最高约70%,成本却要21.6美元。

分更高,钱只要四成。

!Image 6

第三张:OpenAI总裁Greg Brockman亲自官宣——ChatGPT Work把Agent装进了手机,ChatGPT和Codex合体,Agent从工程师的终端,变成了每个人口袋里的同事。

!Image 7

三件事串起来,是同一条主线——这一轮,OpenAI拼的不是谁更聪明,是谁更便宜地聪明。

!Image 8 办公全家桶,集体换脑

这次接管的口号只有一句:每个Token更值钱。

翻译成人话:同样一块钱,GPT-5.6干的活更多。

Word里少提示几轮就出稿;Excel从数据到洞察更快一步;PPT把草稿变成能直接上台的演示。

Cowork更狠——端到端交付成品,连人工协调都省了,你描述结果,它规划、推理、跨工具执行,最后递给你的是成品。

微软Copilot & Agents Core总裁Nitin Agrawal说,「迫不及待想让客户看到GPT-5.6能做什么」——不管是起草文档、分析数据、做演示,还是跨团队协作,产出都会更精致。

!Image 9

除了原生接入模型,微软还会直接通过OpenAI API调用GPT-5.6,服务Microsoft 365客户。双通道,齐上阵。

但这份公告的真正看点,不在技术,在时机。

就在两天前的7月7日,彭博社刚爆了一颗炸弹:微软正在用自研的MAI模型替换Excel和Outlook里的部分OpenAI和Anthropic模型,每周已有数万条AI提示词由MAI处理,理由就两个字——省钱。

!Image 10

OpenAI这份「首选」声明,来得不早不晚,更像一次公开辟谣。 !Image 11 8.4美元,修完一个真仓库的Bug

DeepSWE直接把91个真实开源仓库、5种编程语言丢给模型:

自己看懂代码库结构,诊断Bug在哪,动手修改文件,调用工具执行,跑通测试确认修复,处理多步修复的连锁反应——最后交出的补丁,还要通过程序化验证器这一关才算数。

113个任务解决了多少,就是分数。简单说,是考你能不能像一个真实的软件工程师那样独立干活。

在这张考卷上,GPT-5.6 Sol拿下73%(±3%),平均每个任务只花8.39美元——大约两杯咖啡的钱,修完一个真实仓库的工程任务。

平均输出Token 6万,步骤61步,干脆利落。

而Claude Fable 5最高约70%(±4%),单任务却要烧掉21.63美元,输出Token 11.9万,步骤88步。

分更低,路更绕,钱花了两倍多。

更狠的是,GPT-5.6 Terra——注意,这只是中间档,也拿到了70%的解决率,成本仅4.95美元。

换句话说,OpenAI的二队就已经追平了Anthropic的头牌,而且只花了它四分之一的钱。

!Image 12

对想把Agent批量塞进生产线的企业来说,这道算术题几乎不用算。

Artificial Analysis的编码代理综合指数给出了更完整的画面:GPT-5.6 Sol以80分领跑,比Fable 5高 3 分,输出Token用量不到对手一半,耗时不到一半,成本低约三分之一。

这是全方位碾压。

!Image 13

当模型能力过了可用线,竞争焦点就变了:从「谁更强」,变成「谁用最少的钱干最多的活」。

这一轮,OpenAI把性价比打成了武器。 !Image 14 Agent,进了口袋

第三张牌来自ChatGPT Work,一个把ChatGPT和Codex合二为一的新物种。

ChatGPT Work由GPT-5.6驱动,内置Codex技术,能跨应用、跨文件、跨数据源执行任务——你给它一个目标,它自己拆解步骤、调度工具、生成成品。

OpenAI说它能在一个复杂项目上持续工作数小时。

!Image 15

用Brockman自己的话说,这是可用性和可及性的双升级:不用电脑,手机上直接跑完个人和工作的全套流程。

你在手机上启动一个任务,地铁上审草稿,到公司打开电脑继续——设备之间无缝衔接。它还会从你的修改中学习,越用越懂你的偏好。

Agent从工程师的终端,变成了每个人口袋里的同事。

!Image 16 跑分是表象,窗口才是战场

把三件事放在一张地图上看——

接管微软365,是抢下数亿打工人每天打开的那个窗口;DeepSWE跑分,是证明自己「成本砍半,性能更强」;ChatGPT Work,是把战线从桌面推进到口袋。

三步棋指向同一个逻辑:AI双雄这一轮争的不是榜单,是工作层——谁住进你每天干活的那个界面,谁就住进了全球生产力的入口。

Anthropic有Claude Code和Cowork,OpenAI就用ChatGPT Work和Copilot全家桶来接。

武器不同,战场一样。

参考资料: https://openai.com/index/gpt-5-6-preferred-model-microsoft-365-copilot/ https://x.com/gdb/status/2075628596232884556 https://x.com/gdb/status/2075629132562714744 https://x.com/rohanpaul_ai/status/2075485171663655095

编辑:所罗门 秒追ASI 点赞、转发、在看一键三连 点亮星标,锁定新智元极速推送!

!Image 17

!Image 18

查看原文 → 發佈: 2026-07-11 12:30:00 收錄: 2026-07-11 22:00:46

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。