如果在你熟睡的一整夜里,AI跑了700次实验,等你早上醒来,它已经自己找出了20个改进点,会是怎样的情形?听起来像空想,但这是真实发生过的事。这是曾带领Tesla自动驾驶团队和OpenAI的AI研究者Karpathy在2026年3月公开的开源项目 autoresearch 的故事。
有意思的并不是结果本身。这个项目用极小而清晰的形式,展示了"让任何项目都能自我进化"的一条设计原理。而且这条原理并不局限于AI研究,它 可以原封不动地搬到普通的公司业务中。 今天想聊的就是这件事。
autoresearch究竟做了什么
Karpathy几个月来一直在用手一点点修改训练AI模型的代码。有一天他抛出了一个理所当然的问题:"这活儿我为什么要用手做?把实验交给AI智能体不就行了?"这个问题就成了autoresearch。
它的结构简单得令人吃惊。实际上只有三个文件。
| 文件 | 作用 |
|---|---|
prepare.py |
数据准备。固定 —— 不去动它 |
train.py |
训练代码。智能体可以自由修改的唯一文件 |
program.md |
给智能体的指示文档。不是代码,而是 markdown |
它的运作方式是这样的。智能体把 train.py 改一次,让训练 正好跑5分钟,再用 一个验证分数(衡量模型对下一个词猜得有多准的值,越低越好)来打成绩。变好了就采纳这次改动,变差了就丢弃,然后再尝试下一个想法。每小时约12次,一整夜约100次,全程无人反复进行。
Karpathy亲口点出的核心就是这一句话。
"这不是像研究者那样亲手去动Python文件。而是给智能体提供上下文的
program.mdmarkdown编程。"
也就是说,人做的事不再是改代码,而是变成 定义"朝着什么目标、可以改到什么程度"。 结果很清楚。经过总共700次实验,智能体自行发现了20个优化点,把这些改进应用到更大的模型上后,训练时间缩短了11%。人们开始把这种做法称为"Karpathy Loop"。
也有迹象表明这并非昙花一现的话题。2026年5月,Karpathy加入了Anthropic的预训练研究团队。可以说,autoresearch所展示的"自我进化循环",正与最前沿AI研究机构的实际关注点相契合。
真正的创新不是工具,而是"自我进化的设计"
autoresearch的代码仅有约630行。它受到关注,并不是因为里面藏着什么了不起的技术。值得关注的是,它把 让任何系统都能自我改进的设计骨架,蒸馏到了如此之小的程度并展示出来。这套骨架可以归纳为四点。
- 把可改动的表面收窄为一个。 autoresearch只允许修改
train.py这一个文件。如果什么都能改,既无法控制,也学不到东西。把"可以自由实验的地方"严格限制在唯一一处,这是第一步。 - 用一个数字来定义"更好"。
val_bpb这一个指标就是所有判断的基准。变好还是变差不靠人凭感觉判断,而是由数字代为决定,所以循环才能无人自转。 - 定好时间来跑循环。 一次实验5分钟,采纳或丢弃的判断即时完成。有了短而可重复的周期,一晚上才能尝试100次。快跑一百次,胜过完美地跑一次。
- 人只管方向,执行交给机器。 人所贡献的只有目标选择、指标定义、实验空间的设计——就这三件事。其余的大部分执行工作,如今已经可以自动化。
请留意,这四点里一个"AI模型"这样的词都用不上。正因如此,这套设计才能原封不动地搬到公司业务中。
搬到我们公司的业务里
"一夜之间自我改进的系统"并非大企业研究所的专利。只要是可重复、且成败能用数字衡量的工作,就能套上这四个步骤。
- 客户接待话术:可改的表面 = 首次回复消息的措辞。指标 = 回复率或预约转化率。循环 = AI生成话术变体 → 小规模测试 → 采纳成绩好的一方 → 反复。
- 广告与详情页文案:可改的表面 = 一行标题。指标 = 点击率。人只划定"某种语气绝对不行"这样的边界,把变体的生成与比较交出去。
- 内部业务手册(SOP):可改的表面 = 某个流程中的一个步骤。指标 = 处理时间或失误次数。每周只试验一处改动,变好了就写进手册。不过大多数人恰恰在这里就扣错了第一颗扣子——如果指标只盯"处理时间",速度是快了,质量却会崩。衡量什么,会把结果整个改写。
看出共同点了吗。不是一次性把所有东西都改掉,而是定好一个要改的地方和一个要衡量的数字,用短周期去跑。 只要立下这条纪律,系统就会开始自我改进。
不过有一个必须点明的陷阱。指标定错了,就会去优化错的东西。 如果只把"通话时长缩短"当作指标,就会出现客服急着把客户挂断的情况。数字一旦变成目标,就只有数字变好,真正重要的东西反而崩坏——这种现象通常被称为古德哈特定律。所以在这套方法论里,人真正的工作,是选对指标、并划出不可越过的边界。 跑循环的是机器,但决定往哪个方向跑,始终是人的职责。
IROUMISM在与客户企业开始合作时,最先做的也正是这项工作。哪些业务该放上循环、把什么当作"更好"的指标、允许自动改到哪里、又该在哪里让人叫停——从共同划定这些边界开始,自我进化的系统才真正启动。
结语
autoresearch传递的信息很明确。自我进化的系统,不是来自宏大的技术,而是来自 小而清晰的设计。 一个要改的表面、一个要衡量的数字、一条固定的循环,再加上一个把握方向的人。有这四样,项目就会开始自我改进。
难点在于选择"把什么放上循环"。我们公司的哪项业务最适合这条自我进化循环、该用什么指标来衡量才能避开错误的优化——这些我们会陪你一起理清。
我们公司的业务里,最先能放上"自我改进循环"的会是哪一项?用30分钟免费诊断,帮你找到第一个候选。
