← 回總覽

Qwen3.8 要开源了,我先把它扔进 GitHub 修了个真 Bug

📅 2026-07-24 13:12 AINLP 人工智能 2 分鐘 1416 字 評分: 84
AI 编程 LLM 模型评测 Code Agent GitHub Bug 修复
📌 一句话摘要 作者用标准套餐测试 Qwen3.8-Max-Preview 在真实 GitHub Issue 上修复 Click 和 mypy 的 Bug,并与 GPT-5.6 进行对比。 📝 详细摘要 文章详细记录了作者以 139 元/月的 Token Plan Standard 套餐调用 Qwen3.8-Max-Preview,先在 Click #3571 进度条显示 Bug 上完成复现、定位、修改并通过全部测试,但发现公开已有类似修复,无法证明独立发现;随后转向 mypy #21744 插件类型签名 Bug,模型初次因误判 super 调用的类型而失败,但在得到 Reviewer 提

📌 一句话摘要

作者用标准套餐测试 Qwen3.8-Max-Preview 在真实 GitHub Issue 上修复 Click 和 mypy 的 Bug,并与 GPT-5.6 进行对比。

📝 详细摘要

文章详细记录了作者以 139 元/月的 Token Plan Standard 套餐调用 Qwen3.8-Max-Preview,先在 Click #3571 进度条显示 Bug 上完成复现、定位、修改并通过全部测试,但发现公开已有类似修复,无法证明独立发现;随后转向 mypy #21744 插件类型签名 Bug,模型初次因误判 super 调用的类型而失败,但在得到 Reviewer 提供的反例后能够自我纠正并最终通过全部测试。为验证结果的普遍性,作者将同一 Issue 交给 GPT-5.6 Sol,两模型表现伯仲,均需要外部反例才能完成修复。文章强调,AI 编程助手虽然能够独立定位和修复真实 Bug,但仍离不开严格的代码审查和反例驱动的迭代过程。

💡 主要观点

- Qwen3.8 能在陌生仓库中完成复现、定位、修改并通过全量测试。 在 Click Issue 上,模型自行定位进度条未刷新的根因,补上实现和回归测试,全部测试通过,展示了基本的代码编辑能力。

首次修复虽正确,但因公开已有类似方案,无法证明独立发现新方案。 作者事后查阅发现早在 6 月已有 fork 修复,且上游 PR 已给出相同思路,因而该题不能用于验证模型的原创问题解决能力。
在 mypy Issue 上模型初次因误判 super 调用类型而失败,但在得到 Reviewer 反例后能够自我纠正并最终通过测试。 模型首次把“当前代码所在类”当作“被调用方法的实例类型”,导致在更复杂的 super(Base, other).method(1) 场景下失效;看到反例后它承认错误并修正,最终所有测试通过。
与 GPT-5.6 Sol 的对比显示两模型在同样任务上表现伯仲,均需要外部反例才能完成修复。 GPT-5.6 同样能够定位问题,但初次因误取方法最初定义的类而错误;在得到相同反例后也能自我纠正。两模型在主测试环境下均达到 8192 passed,表明当前顶级 Coding Agent 仍依赖人工审查的反例来完成可靠修复。

💬 文章金句

- 模型没翻车,我的评测题先翻车了。

  • 伯仲之间。

📊 文章信息

AI 初评:84

来源:AINLP

作者:AINLP

分类:人工智能

语言:中文

阅读时间:14 分钟

字数:3315

标签: AI 编程, LLM, 模型评测, Code Agent, GitHub Bug 修复

阅读完整文章

查看原文 → 發佈: 2026-07-24 13:12:00 收錄: 2026-07-25 00:00:45

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。