← 回總覽

不好!1930 年的 AI 都来抢程序员饭碗了

📅 2026-05-03 17:42 衡宇 人工智能 2 分鐘 1392 字 評分: 86
1930模型 talkie-1930 Alec Radford SWE-bench 微调
📌 一句话摘要 有人将仅拥有 1930 年知识的 vintage 大模型微调为软件工程师,仅用 250 个训练样本就成功修复了 xarray 库的 bug,引发对智能本质的重新思考。 📝 详细摘要 本文报道了一项有趣的 AI 实验:研究者将 Alec Radford 等人开发的 talkie-1930-13b 模型(训练数据严格限制在 1931 年 1 月 1 日之前)微调为软件工程师。仅用 250 个训练样本,这个「百岁老头」就成功解决了第一个编程问题——为 xarray 库打补丁。虽然过程耗时 49 轮且效率低下,但模型展现出了与现代 LLM 相似的推理能力:试错、反思、自我修正。当训

📌 一句话摘要

有人将仅拥有 1930 年知识的 vintage 大模型微调为软件工程师,仅用 250 个训练样本就成功修复了 xarray 库的 bug,引发对智能本质的重新思考。

📝 详细摘要

本文报道了一项有趣的 AI 实验:研究者将 Alec Radford 等人开发的 talkie-1930-13b 模型(训练数据严格限制在 1931 年 1 月 1 日之前)微调为软件工程师。仅用 250 个训练样本,这个「百岁老头」就成功解决了第一个编程问题——为 xarray 库打补丁。虽然过程耗时 49 轮且效率低下,但模型展现出了与现代 LLM 相似的推理能力:试错、反思、自我修正。当训练数据扩展到 75K 条 trajectory(10 亿 token)时,模型在 SWE-bench-Verified 上达到 4.5%的 pass@1,而使用互联网数据预训练的兄弟模型仅高出 1 个百分点。文章指出,这一结果表明智能的瓶颈可能不在于预训练数据的多少,一个拥有基本语言理解能力的模型,通过正确的后训练方法,就能产生现代意义上的推理能力。

💡 主要观点

- 仅拥有 1930 年知识的 vintage 大模型,通过微调即可解决现代编程问题。 talkie-1930-13b 模型训练数据严格限制在 1931 年 1 月 1 日之前,但经过 250 个训练样本微调后,成功修复了 xarray 库的 bug,展示了跨时代的推理能力迁移。

微调后的 1930 模型在 SWE-bench 上表现与互联网预训练模型差距极小。 在 SWE-bench-Verified 上,1930 模型达到 4.5% pass@1,而使用互联网数据预训练的兄弟模型仅高出 1 个百分点(5.5%),暗示预训练数据规模可能不是智能的关键瓶颈。
实验引发对智能本质和 Scaling Law 的重新思考。 一个只有 1930 年知识的模型,通过正确的后训练方法就能产生现代推理能力,表明智能的瓶颈可能不在于预训练数据的多少,而在于训练方法和模型架构。

💬 文章金句

- 一个 1930 年代的人,如果拥有几乎相同的教育体系,完全可以理解现代软件工程。

  • 智能的瓶颈,或许从来不在于预训练数据的多少。
  • 你不需要一个训练过所有知识的模型,它只需要具备基本的语言理解能力,这就够了。

📊 文章信息

AI 初评:86

来源:量子位

作者:衡宇

分类:人工智能

语言:中文

阅读时间:8 分钟

字数:1878

标签: 1930模型, talkie-1930, Alec Radford, SWE-bench, 微调

阅读完整文章

查看原文 → 發佈: 2026-05-03 17:42:55 收錄: 2026-05-03 20:00:00

🤖 問 AI

針對這篇文章提問,AI 會根據文章內容回答。按 Ctrl+Enter 送出。