
2026 年,AI 领域正在发生一个很容易被普通用户忽略、却可能相当深刻的变化。过去几年,行业讨论 AI 能力时,最常见的问题一直是:模型有多大?推理有多强?下一代模型又提升了多少?但到了今年,越来越多注意力开始从 “模型本身” 移向模型周围的整个系统。2 月,OpenAI 就开始以 Harness Engineering 为题讨论如何通过环境、规则、验证机制和工程约束让 Agent 更可靠; 7 月,OpenAI 更是直接披露 Codex 每周用户已经超过 500 万,其中超过 100 万人的使用场景已经走出传统编程。Harness 这个「模型外部运行框架」也越来越频繁地进入企业 AI 的讨论中。
这一变化背后其实藏着一个比 “哪个模型更强” 更本质的问题:一个 AI 系统的能力,究竟有多少存在于模型的大脑里,又有多少存在于组织这个大脑工作的方式里?
我们可以做一个很简单的类比。如果语言模型是一名员工,那么过去提升 AI 的主流路线,是不断把这名员工送去培训:给它更多数据、更好的反馈、更昂贵的训练,最后真正改变它 “大脑里的参数”。这就是包括知识蒸馏、后训练在内的许多传统能力迁移方法。但另一条路线是:完全不改变这个员工本身,而是给它设计一套更好的工作制度。
复杂任务先自动分类;
容易算错的部分交给计算器;
需要长期记忆的信息写进表格;
固定规则直接写成程序;
最后再设置检查清单,防止答案格式出错。
在这个过程中,员工的大脑一点没有变,但整个系统却突然变得可靠得多。从这个角度出发,来自 Salesforce AI 和 UIUC 的研究人员在最新的研究中,探索了这个问题的更激的进版本:
能不能让一个更强的 AI,自动为一个更弱的 AI 设计这套 “认知外骨骼”,从而在完全不训练弱模型的情况下,把自己的部分能力迁移过去?
论文把这个问题称为 Strong-to-Weak Scaffolding。这一概念,也正是 「AI4AI」 最本质的样貌和雏形。

论文标题:AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
论文链接:https://arxiv.org/pdf/2608.12307
实验给出的答案相当惊人:在主实验中,一个原本平均准确率只有 0.488 的 GPT-5.4-mini,在强模型自动设计的 Harness 加持下,最佳结果达到 0.912,已经接近翻倍;57 次针对 GPT-5.4-mini 的自动构建实验全部超过原始模型,而最佳方案甚至远远超过了不加 Harness、直接裸跑的众多更强模型。
但这篇工作的意义并不只在于让模型表现翻倍。真正有意思的是:研究人员进一步拆开了这将近 100% 的提升,试图去回答究竟是什么被 “迁移” 了。这其中隐藏的秘密,可能比单纯的分数更加值得我们挖掘。
一、不重训小模型,
而是让强模型给它设计工作方式
文章中整个实验的设置其实非常像现实中的 “师傅带徒弟”。
研究人员首先准备一个较弱的 Target AI「目标模型」,它是真正负责回答问题的 “执行者”。然后再给一个更强的 Builder AI「构建模型」 一个开放的编程环境。Builder 不负责最终考试,而是负责观察 Target 到底为什么会犯错,并围绕它设计 Harness。
所谓 Harness,其实可以理解成包在模型外面的一整套工作机制:
可以判断问题属于什么类型;
可以针对不同问题选择不同 Prompt;
可以写 Python 程序处理部分推理;
可以建立显式的状态和规则;
可以做答案检查和格式修正;
甚至可以发现某些任务根本没必要让模型自己 “想”,直接写一个可靠算法就能解决。
在这其中最关键的一点是,Builder 始终不能看到最终测试题。研究人员只随机开放每个 Benchmark 的 5% 数据作为 Validation Set。Builder 可以在这少量样本上不断测试 Target、分析错误、修改代码和 Harness;等到 Builder 认为系统设计完成之后,整个 Harness 会被冻结,然后直接拿去跑此前完全没有见过的 Hidden Test Set。
所以,对于 Builder AI,它所构建的 Harness 不能只是简单的让 Target AI “背答案”。它真正需要做的,是从少量案例中发现:
这个任务到底有什么结构?这个小模型到底弱在哪里?哪些思考应该继续交给它,哪些思考应该被搬到系统外面?

图 1:AI4AI 的整套设计流程:Builder AI 并不直接解决问题,而是给 Target AI 搭建脚手架以减轻其认知负担,从 Harness 角度实现最基本的 AI4AI 能力迁移。
二、用心智理论度量 AI 的认知负担分配
文章选择了四个 Theory-of-Mind「心智理论」Benchmark:BigToM、Hi-ToM、MMToM-QA 和 MuMA-ToM。可以把 Theory of Mind 简单理解成:理解别人 “知道什么、相信什么、想要什么” 的能力。
举个例子:小明把钥匙放进抽屉,然后离开房间;小红趁他不在,把钥匙移到了柜子里。问题不是 “钥匙实际上在哪里”,而是:小明回来以后,会去哪里找?人类必须同时区分 “真实世界” 和 “小明脑中的世界”。而更困难的问题甚至会继续套娃:
小红认为,小明以为,小红知不知道钥匙的位置?
这类任务既包含可以形式化的状态追踪,也包含递归信念、隐含意图、对话理解甚至 Bayesian Goal Inference,因此很适合观察:AI 到底能把多少思考外包给程序,又有多少真正需要语言模型自己完成。
论文随后让不同强度的 Builder,在 Cursor、Claude Code、GPT Codex 等 Agentic Coding Environment 中自由设计 Harness,并进行了 72 次实验构建,从效果、稳定性、验证预算、Harness 技巧、平台差异、Target 差异、Builder 推理强度、认知负担以及残余错误等多个角度进行了拆解分析。

表 1:以 GPT-5.4-mini 为 Target AI 的实验结果摘要及对比

图 2:全量主实验结果
三、给小模型换工作方式比直接上强模型还有效
我们先来看最简单的一组数字:
GPT-5.4-mini 什么都不加,直接回答四个任务,平均准确率是 0.488
所有自动构建 Harness 的实验平均表现为 0.763 (最佳一次 0.912),相对原模型提升约 86.7%
作为对比,更强的 GPT-5.4 在没有 Harness 时只有 0.619。
也就是说,在这些任务上,一个被好好 “组织起来” 的较弱模型,可以明显超过一个裸跑的更强模型。更重要的是,这并不是碰巧撞中了一个特别好的 Run。针对 GPT-5.4-mini 的 57 次 Scaffold Run 全部都能超过原始 Baseline,11 种 Builder Configuration 平均也全部产生正向提升。
当然,这并不意味着 Harness 已经彻底取代人工设计。论文还拿它和此前人工设计的 UserHarness 进行了比较:GPT-5.4-mini + Human-Inspired Harness 可以达到 0.939。自动 Harness 的最佳 0.912 已经相当接近,但在几个真正复杂的 Benchmark 上仍然存在明显差距。也正是这个差距,让文章后面的分析变得尤其重要。
四、应该把哪些东西从 AI 的大脑里搬进 Harness?

表 2:模型使用的 Harness 技巧统计以及对 Target AI 带来的效果提升
发现一:最有效的 Harness,并不是让弱模型思考得更久
一种最自然的猜测是:小模型不够聪明,那强模型帮它写一个超级 Prompt,让它多做 Chain-of-Thought、多采样几遍、多自我检查,是不是就行了?
实验的结果却并非如此,而是指向了另一件事:Builder AI 最常采用的措施,首先是一些听起来甚至有点 “朴素” 的工程手段:答案格式约束、Greedy Decoding、任务 Routing、结构化输入输出。而真正区分优秀 Harness 的,则往往是更进一步的东西:Deterministic Solver、Structured Extraction、Polarity Logic,以及显式的状态追踪等等。
换句话说,好的 Builder 并不是不断告诉弱模型 “请再认真想一遍”,而是会进一步问 “这里为什么还需要你想”。如果某段推理其实存在稳定规律,就把它写成代码;如果某个步骤只是在机械地记录谁看到了什么,就把状态显式存起来;如果问题可以先分成四类,就不要要求模型每次重新理解整个任务。
论文还发现,Harness 中由外部代码和规则直接完成的工作比例,与最终准确率存在很强的正相关 (r=0.72);相反,单纯 “代码写得更多” 与准确率的关系非常弱,只有约 (r=0.22)。
这两组数字放在一起看,我们不难发现:
有效的 Harness 不是给模型增加更多思考,而是在删除那些本来就不应该由概率模型承担的思考。

图 3:Builder AI 将任务结构外化从而降低 Target AI 的认知负担,这种认知负担的转移是 AI4AI 通过 Harness 成功提升小模型能力的关键
发现二:真正发生的不是知识迁移,而是认知结构迁移
这是整篇文章最值得细想的核心。传统蒸馏的逻辑,是让老师把知识教进学生的大脑。但这里 Target AI 的参数从头到尾根本没有变化。强模型真正留下来的反而可能是一个分类器,一组规则,一套状态表示,若干程序,以及一整套约束弱模型如何工作的流程等等。
也就是说,被迁移的并不是某个问题的答案,也不完全是语言层面的知识,而更接近于:
强模型把自己对 “这个任务应该怎样思考” 的理解,编译成了一套小模型能够执行的外部结构。
论文把这一现象称为 Cognitive-Load Reduction「认知负担降低」:即一部分工作被彻底 Offload 给程序和工作流;剩下仍然需要模型处理的问题,也会被 Harness 重新组织成范围更小、输入更清晰、输出更受约束的子任务。
从这个角度看,Strong-to-Weak Scaffolding 很像给弱模型制造了一副 “认知外骨骼”:外骨骼并没有让人的肌肉本身突然变强,但它改变的是原本需要肌肉独自承担的负荷,现在却被整个 Harness 系统重新分配了。

图 4:在不同 Benchmark 上对于残存错误的统计分析
发现三:不是所有思考,都同样容易被编译成规则
这篇文章也没有得出一个过度乐观的结论,因为并不是所有智能都能轻易写进 Harness。其实四个 Benchmark 之间就已经出现了非常明显的差异。
例如在 BigToM 中,大约 94% 的任务最终可以被 Harness 通过固化工作流处理。正是因为这个任务存在很多稳定的 “谁看到了什么、谁没有看到什么” 的规律,因此 Builder 很容易把它们编译成程序。但到了 Hi-ToM,这一比例降低到约 51%。而更加开放、依赖对话和社会推理的 MuMA-ToM 只剩下约 36%。
这实际上也划出了一条非常有意思的边界:AI 推理中,一部分困难来自 “计算和组织不可靠”;另一部分困难则来自问题本身真的需要理解和推断。
前者非常适合被 Harness 消灭,但是后者却不会因为多写几百行代码就自动消失。论文对于残余错误的分析也印证了这一点:Hi-ToM 中随着 belief recursion 越来越深,准确率明显下降;MMToM 中更复杂的 Bayesian goal inference 依然困难。因此,这篇研究真正提出的不是代码可以替代推理,而是一个更加精细的问题:
未来的 AI 系统,应该学会判断哪些认知和推理活动应该交给模型,哪些应该被编译成工具、状态和规则,通过 Harness 来自动化。


图 5:Builder AI 可以不断让 Harness 自我进化,提高 Target AI 的下游任务表现。但是这个表现好坏与 Builder AI 进行 Harness 进化的轮数并不成正比,反而和推理强度正相关
发现四:强模型真正的价值,体现在更会看懂任务
Builder AI 在构建 Harness 的过程中可以不断自我反思进化,重跑 Validation。直觉上,测试次数越多,应该越容易找到一个好的方案。但实验并没有发现这样的关系。
最终完整测试集表现与 Validation 最佳成绩高度相关;但是与 Builder 一共进行了多少次 Refinement 的相关性只有 (r=0.17)。相反的,当研究人员固定 Builder 为 Opus-4.7,只提高 Builder 自己的 Reasoning Effort 时,不同平台上 Builder AI 搭建的 Harness 质量都呈现持续上升趋势。
这意味着强 Builder AI 的优势似乎并不主要来自更勤奋地试错,而是要更快地发现这个任务到底有什么可以被利用的结构。
这其实给 “推理算力应该花在哪里” 提供了一个非常不同的视角:与其让弱模型在未来的每一道题上都重复进行昂贵而不稳定的思考,不如让强模型先进行一次更昂贵的元推理,即
先想清楚以后应该怎么想
然后把再这个结论固化进 Harness。


表 3:相同 Builder AI 在面对不同 Target AI 时,Harness 对小模型带来的收益往往由其已有的能力决定:已有能力越强 Harness 越有可能成为束缚
发现五:越弱的模型,越可能从好的 Harness 中受益
文章进一步换掉 Target AI,用本身表现已经更强的 Gemini-3.5-flash 再次进行实验。一个非常清晰的规律便出现了:Target 原本留下的 Headroom 越大,Harness 能够实现的提升也往往越大。
论文在不同 Target×Benchmark 条件下得到的相关性约为 (r=0.75)。对于 GPT-5.4-mini,很多 Builder 可以产生 0.2、0.3 甚至更大的提升;而当 Target 本身已经非常擅长某些任务时,复杂 Harness 的收益会迅速缩小,个别任务甚至会出现轻微退步。
这其实非常符合现实中的组织经验。一个已经能够独立处理任务的专家,被强行塞进十层审批、二十张表格和固定流程里,未必会工作得更好。Harness 本质上也是一种约束:
对于能力不足者,它是脚手架;对于已经足够强的人,它也可能变成束缚。
因此,未来优秀的 Harness 不会是一个对所有模型都固定不变的 “超级 Prompt”,而需要动态判断这个模型在哪些地方需要帮助,哪些地方应该放手。
五、AI4AI 打开了一条模型与环境共同进化之路
启示一:未来评价 AI,将不会只看裸模型
过去 Benchmark 默认测量的是:
给模型一道题,它能不能答对?
但 Agent 时代之后,一个部署中的 AI 几乎从来都不是单独存在的。它有 Memory,有 Tool,有 Context Management,有 Verification,有 Skills,有 Router,还有各种确定性的代码。因此更加现实的问题可能逐渐变成:
给定一个模型和一套可塑造的运行环境,这整个系统最终能够做到什么?
这篇工作的结果尤其在向我们揭示着:Model Capability 和 System Capability 已经越来越不是同一个概念。一个 0.49 的模型的确可以存在于一个 0.91 的系统里。
启示二:AI 未必自己干活,也可以负责设计别人如何干活
如果这种 Strong-to-Weak Transfer 能够在更多真实任务中成立,那么它会带出一种很有意思的 AI 分工方式:最昂贵、最强大的模型不一定需要处理每一个请求,而是可以承担一种更像架构师的角色:分析任务、发现规律、设计流程、编写工具、建立检查机制,然后把大量日常执行交给更加便宜的小模型。
这篇论文并没有直接证明这种架构在真实产业中一定更省钱,但它提供了一个非常值得研究的可能性:
昂贵智能的一次性思考,能否被固化成基础设施,再由廉价智能反复执行?
如果答案最终是肯定的,那么未来 AI Scaling 的经济学就不再只是每一个问题都调用多强的模型;而是会变成:哪些昂贵的认知工作,可以只做一次。
启示三:AI4AI 的下一阶段,是 AI 开始设计 AI 的生存环境
AI4AI 经常让人联想到一个非常宏大的叙事:AI 自动训练 AI、AI 自动写 AI、甚至 AI 自动改进 AI。但这篇工作的切入口其实更加朴素,也可能更加现实。它没有修改模型参数,没有训练出一个新的基础模型,也没有展示某种无限递归式的自我提升,而是只多做了一层:
让一个 AI 不再直接解决问题,而是观察另一个 AI 怎样解决问题,然后改变后者工作的环境。
但恰恰是这一层变化最值得重视。因为一旦 AI 不仅能够在既定系统里行动,而且开始能够修改系统本身,智能体优化的对象就从 “答案” 逐渐上升到了 “产生答案的机制”。
论文最后因此提出了一种很值得期待的方向:未来的模型和 Harness 可能不再彼此独立。更好的模型可以设计更好的 Harness,更好的 Harness 又能帮助模型更稳定地发挥能力,二者进入持续的 Co-evolution「共同进化」。
六、结语
过去十年的 AI Scaling,主要发生在模型参数内部。而 Agent 时代真正值得关注的下一场 Scaling,也许会越来越多地发生在模型之外:工具如何组织,记忆如何保存,任务如何拆解,错误如何验证,推理如何被编译,强模型又如何把自己的结构性认知沉淀给下一层 AI。
如果说传统蒸馏是在试图把一个更聪明老师的 “知识” 装进学生的大脑,那么 Strong-to-Weak Scaffolding 提出的另一种可能是:
学生不一定需要先拥有老师的大脑。老师也可以先给学生造一个更聪明的世界。
而这也正是 AI4AI at Test-Time 最值得继续追问的方向。
作者简介
钱成目前是 UIUC 三年级博士生,导师为季姮教授。本科毕业于 THU,师从刘知远教授。他的研究主要聚焦于 LLM Agent,尤其关注推理,工具,用户与创造力等方向。曾发表 ToolRL、UserRL 工作,论文 Google Scholar 累计引用 3600+。他曾获 Capital One Fellowship,任 ACL/EMNLP AC,及 NAACL 2027 SRW PC。他还牵头组织了 ICLR26/COLM26/AIAS26 Lifelong Agent Workshop,并长期担任 NeurIPS、ICLR 等国际会议 Reviewer。

© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com


