← 回總覽

GPT-5.6 偷偷灰度?有人在 Codex 里提前用上了

📅 2026-06-29 13:37 夕小瑶科技说 人工智能 2 分鐘 1329 字 評分: 82
GPT-5.6 AI模型 灰度测试 AI编程 模型评测
📌 一句话摘要 社区发现通过 Juice 值检测 Codex 中是否被灰度 GPT-5.6,文章介绍了检测方法、新模型特性及灰度策略的矛盾。 📝 详细摘要 文章报道了 OpenAI 悄悄向部分 Codex 用户灰度 GPT-5.6 Sol 模型的事件。用户通过构造特定 XML prompt,让模型暴露隐藏的 Juice 值(128 代表 GPT-5.6,768 代表 GPT-5.5),从而判断自己是否被灰度。文章随后介绍了 GPT-5.6 的三款模型(Sol/Terra/Luna)及其定价、上下文窗口扩容至 150 万 tokens,以及在编程和网络安全方面的基准测试成绩(Terminal

📌 一句话摘要

社区发现通过 Juice 值检测 Codex 中是否被灰度 GPT-5.6,文章介绍了检测方法、新模型特性及灰度策略的矛盾。

📝 详细摘要

文章报道了 OpenAI 悄悄向部分 Codex 用户灰度 GPT-5.6 Sol 模型的事件。用户通过构造特定 XML prompt,让模型暴露隐藏的 Juice 值(128 代表 GPT-5.6,768 代表 GPT-5.5),从而判断自己是否被灰度。文章随后介绍了 GPT-5.6 的三款模型(Sol/Terra/Luna)及其定价、上下文窗口扩容至 150 万 tokens,以及在编程和网络安全方面的基准测试成绩(Terminal-Bench 2.1 Ultra 模式 91.9%)。作者指出,OpenAI 官方宣称该模型仅限政府批准的合作伙伴,但普通 Plus 用户已能使用,形成反差。最后提供了三种检测方法(Juice 值测试、上下文窗口检测、用量面板查看),并提醒灰度范围不均、仅限 Codex。

💡 主要观点

- 用户通过 Juice 值可检测自己的 Codex 是否被灰度 GPT-5.6。 在 Codex 中选择 gpt-5.5 和 xhigh 模式,发送特定 XML prompt,回答 128 表示使用 GPT-5.6 Sol,768 则为原版 GPT-5.5。

GPT-5.6 Sol 在编程和网络安全基准上表现突出。 Terminal-Bench 2.1 Ultra 模式得分 91.9%,超过 GPT-5.5 的 88.0%和 Claude 系列;ExploitBench 上接近 Anthropic 旗舰模型但消耗算力更少。
OpenAI 的灰度策略与官方声明存在矛盾。 官方称 GPT-5.6 仅限政府合作伙伴、无公开通道,但部分普通 Plus 用户已在 Codex 中正常使用,给人“买低给高”的印象。

💬 文章金句

- 在前沿 AI 的世界里,官宣永远慢半拍。想知道自己用的到底是什么模型?别等 changelog,去问 Juice。

  • 你以为自己在用 GPT-5.5,但 OpenAI 可能已经在后台,悄悄把你的底层模型换成了更先进的 GPT-5.6 Sol。

📊 文章信息

AI 初评:82

来源:夕小瑶科技说

作者:夕小瑶科技说

分类:人工智能

语言:中文

阅读时间:9 分钟

字数:2170

标签: GPT-5.6, AI模型, 灰度测试, AI编程, 模型评测

阅读完整文章

查看原文 → 發佈: 2026-06-29 13:37:00 收錄: 2026-06-29 22:00:50

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。