有人将仅拥有 1930 年知识的 vintage 大模型微调为软件工程师,仅用 250 个训练样本就成功修复了 xarray 库的 bug,引发对智能本质的重新思考。
📝 详细摘要
本文报道了一项有趣的 AI 实验:研究者将 Alec Radford 等人开发的 talkie-1930-13b 模型(训练数据严格限制在 1931 年 1 月 1 日之前)微调为软件工程师。仅用 250 个训练样本,这个「百岁老头」就成功解决了第一个编程问题——为 xarray 库打补丁。虽然过程耗时 49 轮且效率低下,但模型展现出了与现代 LLM 相似的推理能力:试错、反思、自我修正。当训练数据扩展到 75K 条 trajectory(10 亿 token)时,模型在 SWE-bench-Verified 上达到 4.5%的 pass@1,而使用互联网数据预训练的兄弟模型仅高出 1 个百分点。文章指出,这一结果表明智能的瓶颈可能不在于预训练数据的多少,一个拥有基本语言理解能力的模型,通过正确的后训练方法,就能产生现代意义上的推理能力。
💡 主要观点
- 仅拥有 1930 年知识的 vintage 大模型,通过微调即可解决现代编程问题。 talkie-1930-13b 模型训练数据严格限制在 1931 年 1 月 1 日之前,但经过 250 个训练样本微调后,成功修复了 xarray 库的 bug,展示了跨时代的推理能力迁移。
💬 文章金句
- 一个 1930 年代的人,如果拥有几乎相同的教育体系,完全可以理解现代软件工程。
- 智能的瓶颈,或许从来不在于预训练数据的多少。
- 你不需要一个训练过所有知识的模型,它只需要具备基本的语言理解能力,这就够了。
📊 文章信息
AI 初评:86
来源:量子位
作者:衡宇
分类:人工智能
语言:中文
阅读时间:8 分钟
字数:1878
标签: 1930模型, talkie-1930, Alec Radford, SWE-bench, 微调