← 回總覽

更强模型在非主流工具 schema 上工具调用反而倒退的深度分析

📅 2026-07-06 08:53 meng shao 人工智能 1 分鐘 1220 字 評分: 85
AI模型 工具调用退化 Claude Opus 4.8 Sonnet 5 RL过拟合
📌 一句话摘要 Armin Ronacher 发现 Claude Opus 4.8 和 Sonnet 5 在嵌套工具 schema 上调用失败率升高,揭示 RL 后训练对特定 harness 过拟合的问题。 📝 详细摘要 详细解释问题现象和根因分析:新模型在长 agentic 历史下会在 edit 对象末尾发明垃圾字段,原因是 Anthropic 模型后训练在 Claude Code 的 forgiving harness 中进行,模型学到了“可以多带可选字段”的先验,导致非标准 schema 下失败。比较了 OpenAI 的约束解码路线。给出对 harness 开发者的四点含义。 📊

Title: In-Depth Analysis: Better Models Show Regression in Tool ...

URL Source: https://www.bestblogs.dev/status/2073933413095288874?amp%3Butm_medium=feed&%3Butm_campaign=resources&%3Bentry=rss_article_item

Published Time: 2026-07-06 08:53:52

Markdown Content: Skip to main contentAudio 2 ![Image 1: LogoBest Blogs](https://www.bestblogs.dev/ "BestBlogs.dev")

Search Ctrl+K

Change language Switch ThemeSign In

Curated Daily BriefWeekly PicksTopics SettingsHelp CenterCollapse

Loading... HomeDiscoverSettings

查看原文 → 發佈: 2026-07-06 08:53:52 收錄: 2026-07-06 14:00:38

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。