一、一个震撼行业的等式:Agent = Model + Harness
2026年,AI工程界达成了一个前所未有的共识,用一个等式来表述:
一个AI Agent的实际表现,是基础模型能力(Model)和运行时基础设施(Harness)的乘积效应——而非简单相加。这意味着:一个0.7分的模型配上1.5分的Harness,可以击败一个0.9分的模型配上1.0分的Harness。
这个等式并非空穴来风。它来自2026年一系列严肃的实证研究:
1.1 三大关键数据点
同一模型,仅改变Harness代码,Benchmark性能波动达到6倍。研究者首次提出"Harness是可独立优化的工程变量"。
同一个模型在裸跑(无Harness)时得分69%,配上包含重试逻辑和迭代文件探索的精细Harness后,得分跃升至81%——提升了12个百分点,相当于跨越了两个模型代际。
三个不同的Agent框架运行完全相同的Opus 4.5模型,在731个问题的评测中,最好和最差的结果相差了17个Issue——效果差2.3倍。模型完全一样。
1.2 "70%定律":性能的决定权在哪里?
2026年4月,一篇广为流传的分析文章提出了一个被行业广泛引用的论断:
包括:上下文工程、工具设计、重试策略、记忆系统、错误恢复、权限控制、人机交互设计——这些统统属于Harness的范畴。模型本身只贡献了约30%的"原始推理力"。
这意味着什么?如果两个模型的原始能力差距是10%,经过Harness放大后,这个10%对最终性能的贡献只有10% × 30% = 3%。3%的差异——用户根本感知不到。
二、模型能力的「大收敛」:为什么差距在缩小
要理解Harness为什么能抹平模型差距,首先要看清一个事实:前沿模型的能力正在快速收敛。
2.1 Benchmark饱和现象
2026年中期,主流Benchmark(MMLU、HumanEval、GSM8K等)已经被前沿模型"刷穿"了:
| MMLU | ||||
| HumanEval | ||||
| GSM8K | ||||
| SWE-bench Verified |
在传统Benchmark上,前沿模型的差距已经压缩到2%以内。即使在更贴近真实场景的SWE-bench上,差距也只有5-6%——而且其中很大一部分可以被Harness工程弥补。
2.2 "收敛阈值"的位移
Kilo AI在2026年初提出了一个重要概念:"LLM收敛阈值"(Convergence Threshold)——指基础模型能力达到某个水平后,进一步的能力提升对用户可感知体验的边际贡献急剧递减。
图1:模型能力-用户体验收益曲线。过收敛阈值后,配Harness的曲线迅速趋于平坦——模型差距被抹平
这张图传达的核心信息极其重要:当模型能力超过"收敛阈值"(大约Benchmark 80分)后,配了Harness的曲线几乎变成了一条水平线。在这个区间内,模型从85分提升到95分(提升10%),用户体验的提升趋近于零。
而2026年的前沿模型——GPT-5、Claude Opus 4、Gemini 3、甚至DeepSeek V4——全部已经越过了这个收敛阈值。
三、Harness如何"抹平"模型差距?六大均衡机制
为什么Harness能有如此强大的均衡效应?因为它在六个层面上系统性地补偿了模型的能力差异:
3.1 重试与自我纠正循环
1 重试策略(Retry & Self-Correct)
弱模型第一次可能给出错误答案。但Harness可以在检测到错误后自动重试——把错误反馈给模型,要求它纠正。SWE-bench数据显示,仅此一项就能把成功率从69%提升到81%。强模型的优势是"一次就对",但Harness让弱模型"多试几次也对"——最终结果一样。
3.2 任务分解与工具补偿
2 任务分解(Task Decomposition)
复杂推理是强模型的杀手锏。但Harness可以把复杂任务拆解成简单子任务——每个子任务的难度都在弱模型的能力范围内。一个需要90分推理力的任务,被拆成5个只需要75分子任务,弱模型也能完美执行。
3.3 上下文工程
3 上下文工程(Context Engineering)
强模型的优势之一是"在信息不完整时也能推理"。但Harness通过主动提供完整上下文——相关文件、历史决策、项目约定——消除了对模型内在知识的依赖。"给弱模型足够信息"比"用强模型脑补"更可靠。
3.4 验证与守卫机制
4 输出验证(Output Validation)
Harness可以在模型输出后自动验证:跑测试、检查语法、对比预期格式。如果验证失败,自动触发重试。强模型自带更高的"一次性正确率",但Harness的验证循环让弱模型的最终输出质量追平——因为错误在到达用户之前就被拦截了。
3.5 记忆系统
5 外部记忆(External Memory)
强模型的"隐性知识"更丰富。但Harness的分层记忆系统(如Hermes的四层记忆)通过持久化所有关键知识到磁盘,让弱模型也能"查阅"到强模型"脑中"有的信息。记忆系统把模型间的知识差距转化为了"查表"操作。
3.6 子Agent委托
6 子Agent路由(Sub-Agent Delegation)
对于超出当前模型能力的子任务,Harness可以路由到更强的专用模型。主Agent用便宜的80分模型处理80%的任务,只在遇到高难度子任务时调用贵的95分模型。最终效果和全程用95分模型一样——但成本低了数倍。
图2:Harness六大均衡机制——弱模型经过Harness层后,输出质量逼近强模型
四、一个真实的思想实验:两个Agent的故事
让我们用一个具体的业务场景来具象化这个论证。假设有两个AI编码Agent:
| 模型 | ||
| 模型差距 | ||
| Harness | 重试逻辑 + 任务分解 + 分层记忆 + 输出验证 + 子Agent路由 | |
| 用户任务 | ||
| 最终体验 | ||
| 用户感知差异 |
为什么?因为这个任务虽然需要推理能力,但没有超出80分模型的能力天花板。Harness的重试机制补偿了偶尔的首次失误,上下文工程确保了所有必要的文件信息都被注入,输出验证拦截了任何潜在错误。最终,用户拿到了一份正确重构的代码——和用90分模型的结果一模一样。
但Agent A的成本可能只有Agent B的1/5。
五、但是——模型差距真正无法被抹平的地方
作为一个严谨的论述,我们必须承认Harness均衡效应有其边界。以下是Harness工程无法完全弥补模型差距的几种情况:
5.1 "能力地板"之下的任务
如果一个任务的本质难度要求模型至少有85分的推理力,而你的模型只有70分——再多的重试、分解、上下文都无济于事。重试10次还是错,分解后的子任务依然太难,上下文再完整模型也推不出来。这就是"能力地板"——模型必须在地板之上,Harness才能发挥作用。
5.2 延迟敏感型任务
弱模型可能需要3次重试才给出正确答案,而强模型1次就对。虽然最终结果一样,但响应时间可能差3倍。在对延迟极其敏感的场景(实时对话、交互式编程),这个差距是可感知的。
5.3 真正的深度推理
Apple的"Illusion of Thinking"研究和ICLR 2026 Workshop都指出:在数学证明、复杂逻辑推理、需要真正"理解"而非"模式匹配"的任务上,模型差距依然显著。这些任务的难度可能高于当前所有模型的"能力地板",因此Harness的补偿效果有限。
5.4 多模态理解
在视觉推理、空间理解、视频分析等多模态任务上,模型间的能力差距远大于文本任务。一个VLM(视觉语言模型)如果"看不懂"图片中的关键细节,Harness很难通过重试来弥补。
5.5 幻觉率差异
强模型的核心优势之一是更低的幻觉率。Harness可以通过输出验证来拦截部分幻觉,但对于看起来正确实际上错误的"高置信度幻觉",验证机制也力有不逮。这在对准确性要求极高的领域(医疗、法律、金融)可能是关键差异。
图3:Harness均衡效应的有效区间、过渡区和失效区
六、「分辨率」框架:在不同颗粒度下看差距
模型差距是否可感知,取决于你用什么"分辨率"来看:
图4:「分辨率」框架——在粗颗粒度下模型差距被抹平,细颗粒度下仍有差异
这个框架的关键洞察是:对于80%的日常任务(粗颗粒度),配了Harness后模型差距确实是零。只有5%的极限任务(细颗粒度),模型差距才真正显著——但这类任务在真实业务中的占比极小。
七、对行业的深层影响:谁在受益,谁在焦虑
7.1 模型公司的「商品化陷阱」
Harness均衡效应最直接的受害者是前沿模型公司本身。当它们的模型差距被Harness抹平后:
- 定价权丧失
:用户发现便宜模型+好Harness和贵模型+好Harness效果差不多,为什么还要付高价? - 差异化困难
:每家的Benchmark都刷到了90+分,用户很难感知到差异。 - 价值链下移
:利润从模型层向Harness层转移。做Harness的公司(如Anthropic做Claude Code)比做裸模型的公司更有话语权。
这也解释了为什么Anthropic、OpenAI都在拼命做自己的Harness产品(Claude Code、Codex、Cursor)——它们深知:光卖模型API的时代快结束了,未来的价值在Harness。
7.2 开源模型的「弯道超车」
DeepSeek V4、Qwen 3.6等开源模型是Harness均衡效应的最大受益者:
它们的能力已经越过了收敛阈值(~80分),在Harness加持下可以媲美闭源前沿模型。 自托管+低延迟+零API成本——在经济效率上碾压闭源方案。 DeepSeek和Qwen已经拿下全球AI市场约15%的份额,且增速远超闭源模型。
7.3 应用层的「黄金时代」
对于做AI应用的公司来说,这是一个前所未有的黄金时代:
- 模型选择不再是生死攸关的决策
——选一个过了收敛阈值的模型就行。 - 核心竞争力转向Harness Engineering
——谁的工具链更好、谁的记忆系统更聪明、谁的重试策略更优雅。 - 护城河从"接入最强模型"变成"拥有最好的Harness"
——这是可以自建的、不受模型公司控制的能力。
八、决策框架:什么时候该用强模型,什么时候不需要
基于以上分析,我们可以提炼出一个实用的决策框架:
| 日常编码、文本处理、 客服、自动化流程 | ||
| 高流量、延迟敏感型 应用(实时对话、IDE插件) | ||
| 深度推理、数学、 复杂架构设计 | ||
| 医疗、法律、金融等 高风险领域 | ||
| 多模态理解(图像、 视频、空间推理) |
80%的任务只需要一个过了收敛阈值的模型 + 精心设计的Harness。剩下20%的极限任务才需要押注最强模型。
聪明的架构是:80%流量走便宜模型(Harness兜底),20%高难度任务路由到强模型——这就是子Agent路由模式的精髓。
九、结论:回答那个核心问题
回到文章开头的问题:
答案是:在大约80%的真实业务场景下——是的,完全感知不到。
前提条件:
① 两个模型都已经越过了"收敛阈值"(Benchmark ~80分)
② 使用了同样精心设计的Harness
③ 任务不涉及深度推理、多模态理解或极高风险决策
但如果你的任务恰好落在那5%的"失效区"里——模型差距依然关键,Harness无法替你作弊。
对于绝大多数AI应用团队来说,现在最正确的投资不是追逐最新的SOTA模型,而是打磨你的Harness。因为:
模型每6个月迭代一次,但Harness的工程积累是持续复利。 模型能力是供应商的,但Harness能力是你自己的。 在模型差距被抹平的世界里,Harness就是护城河。
如果你不是模型,那你就是Harness。在这个时代,建Harness的人比训模型的人更掌握命运。
参考资料与延伸阅读
[1] arXiv - Meta-Harness: End-to-End Optimization of Model Harnesses(斯坦福/MIT,6倍性能差距)
[2] Medium -The Agent Harness: Why 70% of Your AI Agent's Performance Lives Outside the Model
[3] OpenReview -Stop Comparing LLM Agents Without Disclosing the Harness
[4] Tianpan.co -Agentic Coding in Production: What SWE-bench Scores Don't Tell You(69% → 81%)
[5] MarkTechPost -Best AI Agents for Software Development Ranked(同模型2.3x差距)
[6] Kilo AI -The LLM Convergence Threshold Has Shifted
[7] Business Engineer -The Harness as the Agentic Moat
[8] NxCode -GPT-5.3 Codex vs Claude Sonnet 4.6("scaffolding matters more than model")
[9] Hacker News -Improving 15 LLMs at Coding in One Afternoon. Only the Harness Changed.
[10] Apple ML Research -Understanding the Strengths and Limitations of Reasoning Models
[11] ICLR 2026 -I Can't Believe It's Not Better: Where LLMs Need Improvement
[12] Preprints.org -Agent Harness for Large Language Model Agents: A Survey
[13] Stanford HAI -AI Index Report 2026: Technical Performance
[14] CoderCops - DeepSeek and Qwen Captured 15% of the Global AI Market




