推理越长越糟?ICML 2026 证明:CoT 超过约 25 步就开始崩,必须交给工具
推理越长越糟ICML 2026 证明CoT 超过约 25 步就开始崩必须交给工具系列第 2 篇 · 子领域推理优化 / Reasoning【来源信息】 - 类型顶刊/顶会论文 - 标题The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary - 作者/机构Dongxin Guo, Jikun Wu, Siu Ming Yiu - 出处ICML 2026 录用arXiv 评论区明确标注 Accepted at ICML 2026 arXiv:2606.00376 提交日期 2026-05-29 - 原文https://arxiv.org/abs/2606.00376 - 本文性质论文解读非原创研究理论结论与数字以原文为准一句话结论别再无脑拉长思维链CoT了。一篇 ICML 2026 从信息论层面证明在需要精确状态追踪的任务上纯神经推理存在一个确定性边界 d* ∈ [19, 31] 步——超过它准确率开始超指数级崩塌唯一解法是把任务甩给外部工具tool delegation。背景与痛点推理时计算test-time compute火了之后大家默认让模型多想想更长的 CoT总没错。o1/R1 类模型也在鼓励长思考。但这篇论文泼了盆冷水在确定性状态追踪类任务上比如根据一串操作维护数据库状态按对话历史跟踪变量更长的 CoT 不仅没用反而显著掉点。而且作者特意排除了最常见的甩锅对象——不是模型的偏好偏差preference bias导致的,而是根植于decoder-only 注意力机制本身的信息论容量上限。换句话说这是架构的锅不是训练没训好。这对 Agent 系统设计是颗炸弹你花大力气训出来的长思考 Agent在状态追踪场景可能越想越错。核心方法讲人话论文做了四件事层层递进Attention Bottleneck Theorem注意力瓶颈定理给出状态追踪容量的理论上界容量 ∼ O(H·log(L/H)·√d_h)其中 H 是层数、L 是序列长度、d_h 是头维度。含义直白随着要追踪的状态变长注意力能稳定记住的信息有硬上限不是无限可扩的。上下文相关错误模型 → 超指数衰减基于此推导出误差随推理步数增长的模型结论是准确率随步数超指数级super-exponential衰减——不是慢慢掉是过了某个点后断崖式崩。State-Space Jaccard 度量作者提出一个指标用来区分模型是真没能力还是只是偏好选错。这步很关键它把能力失败和偏好失败拆开避免把架构问题误判成对齐问题。Deterministic Horizon d*综合上述定义一个确定性边界 d* ∈ [19, 31]一旦任务需要的推理/状态追踪步数超过这个区间纯神经推理就不该再硬扛必须委托给工具查数据库、跑代码、调用 API。论文里点题的一句引译a Deterministic Horizon d*∈[19,31] beyond which tool delegation becomes necessary.这就是标题的由来。实验与数字跨12 个模型、8 个任务域含 SWE-Bench、WebArena、SQL-Multi验证推理方式主模型套件准确率工具集成推理tool-integrated86–94%纯神经 CoT24–42%差距是碾压级的。更有说服力的两点微调救不了在最优长度轨迹上微调提升5%——证实这是架构天花板不是数据没喂够。跨模型高度相关相关系数 r0.81–0.91说明失败是架构性的、与具体训练无关不是某个模型没训好。说明以上数字与定理均来自摘要定理证明、Jaccard 度量的具体构造见原文正文。本文基于摘要与公开信息解读。为什么重要反直觉得有点反常识多想在某些情况下是负优化。这直接挑战了推理越长越好的朴素信仰。对做 AI 应用的工程师三个立刻能用上的启示别无脑堆 CoT涉及状态追踪、精确计数、长链路依赖的任务长思考可能有害先做工具化让模型调函数/查库比让它自己想更稳。感知你的 d*给你的 Agent 任务画一条状态追踪深度线超过 ~25 步就强制转工具而不是继续生成 token。混合架构是正解论文结论指向pure neural reasoning 该让位给 hybrid approach——这和你前面几辑做 Agent 的思路一致模型负责决策工具负责精确执行。复现/落地思路理论可验Attention Bottleneck 的容量上界是解析结论有数学基础可对照原文定理自行推演。实验可复8 个任务域里 SQL-Multi、SWE-Bench 都是公开 benchmark你可以拿手上的模型跑纯 CoT vs 工具集成的对照验证 d* 是否落在 19–31。最小验证步骤① 选一个状态追踪任务如多轮后问当前购物车总额② 让模型纯 CoT 答记录步数与正确率③ 接一个查状态工具再答④ 画出步数—准确率曲线看断崖是否出现在 ~25 步附近。今日可做的 3 件事把这篇 ICML 2026 的摘要2606.00376存进你的Agent 设计原则笔记标一句长思考 ≠ 总更好。排查你现有 Agent哪些环节在让模型自己追踪长状态列出可改为调工具查状态的清单。用任意一个公开模型跑一次纯 CoT vs 工具对照小实验亲手验证 d* 的存在感。下篇预告第 3 期我们读长上下文子领域看一篇 7 月的硬核工程论文 LongStraw——「只用 8 张 H20就在 210 万 token 上做 RL 训练」把推理长度和训练长度的鸿沟填平的那种。

相关新闻