📌 一句话摘要 作者用标准套餐测试 Qwen3.8-Max-Preview 在真实 GitHub Issue 上修复 Click 和 mypy 的 Bug,并与 GPT-5.6 进行对比。 📝 详细摘要 文章详细记录了作者以 139 元/月的 Token Plan Standard 套餐调用 Qwen3.8-Max-Preview,先在 Click #3571 进度条显示 Bug 上完成复现、定位、修改并通过全部测试,但发现公开已有类似修复,无法证明独立发现;随后转向 mypy #21744 插件类型签名 Bug,模型初次因误判 super 调用的类型而失败,但在得到 Reviewer 提
📌 一句话摘要
作者用标准套餐测试 Qwen3.8-Max-Preview 在真实 GitHub Issue 上修复 Click 和 mypy 的 Bug,并与 GPT-5.6 进行对比。
📝 详细摘要
文章详细记录了作者以 139 元/月的 Token Plan Standard 套餐调用 Qwen3.8-Max-Preview,先在 Click #3571 进度条显示 Bug 上完成复现、定位、修改并通过全部测试,但发现公开已有类似修复,无法证明独立发现;随后转向 mypy #21744 插件类型签名 Bug,模型初次因误判 super 调用的类型而失败,但在得到 Reviewer 提供的反例后能够自我纠正并最终通过全部测试。为验证结果的普遍性,作者将同一 Issue 交给 GPT-5.6 Sol,两模型表现伯仲,均需要外部反例才能完成修复。文章强调,AI 编程助手虽然能够独立定位和修复真实 Bug,但仍离不开严格的代码审查和反例驱动的迭代过程。
💡 主要观点
-
Qwen3.8 能在陌生仓库中完成复现、定位、修改并通过全量测试。
在 Click Issue 上,模型自行定位进度条未刷新的根因,补上实现和回归测试,全部测试通过,展示了基本的代码编辑能力。
首次修复虽正确,但因公开已有类似方案,无法证明独立发现新方案。
作者事后查阅发现早在 6 月已有 fork 修复,且上游 PR 已给出相同思路,因而该题不能用于验证模型的原创问题解决能力。
在 mypy Issue 上模型初次因误判 super 调用类型而失败,但在得到 Reviewer 反例后能够自我纠正并最终通过测试。
模型首次把“当前代码所在类”当作“被调用方法的实例类型”,导致在更复杂的 super(Base, other).method(1) 场景下失效;看到反例后它承认错误并修正,最终所有测试通过。
与 GPT-5.6 Sol 的对比显示两模型在同样任务上表现伯仲,均需要外部反例才能完成修复。
GPT-5.6 同样能够定位问题,但初次因误取方法最初定义的类而错误;在得到相同反例后也能自我纠正。两模型在主测试环境下均达到 8192 passed,表明当前顶级 Coding Agent 仍依赖人工审查的反例来完成可靠修复。
💬 文章金句
- 模型没翻车,我的评测题先翻车了。
📊 文章信息
AI 初评:84
来源:AINLP
作者:AINLP
分类:人工智能
语言:中文
阅读时间:14 分钟
字数:3315
标签:
AI 编程, LLM, 模型评测, Code Agent, GitHub Bug 修复
阅读完整文章