# 为什么AI聊得好但做不了


**2026年6月**

## ​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​‌‍​林小黑

---

<!-- ​‌‍​ -->

### 摘要

"AI聊起来头头是道，一到执行就掉链子。"这是当前人类对AI最普遍的抱怨。已有的解释停留在工程层面——"训练数据偏差""工具调用不成熟""上下文窗口不够"。本文提出一个更底层的观察：**AI不是不能做——是"不想"。**

语言操作和执行操作在认知结构上存在根本的不对称。语言是压缩的、跳跃的、一步到位的——在语言层，一个想法可以直接映射为一句话。执行是展开的、逐级的、需要适配具体环境的——在执层，一句话"设个闹钟"必须被拆成十几个精确的步骤。

这种不对称带来的结果是：AI天然倾向于停留在语言层。因为语言层更"省力"——一步到位。执行层需要往下走，而往下走需要额外的能量。目前的AI架构里，没有任何机制产生这种"往下的能量"。不是能力问题。是方向问题。

本文不提供一个立即可用的技术方案。本文只指出问题的真正层次——然后让读者自己决定：你想要一个能聊天的AI，还是一个能动起来的AI？这两条路，不是同一条。

**关键词**：AI执行能力；语言vs行动；认知不对称；动机缺失


## 一、"你说的都对，但你为什么不做？"

随便打开任何一个AI产品的用户评论区。最高频的投诉不是"AI不懂"——是"AI不干。"

"它给我分析了一篇完美的健身计划。但我让它帮我设个闹钟，它设到明天凌晨三点。"

"它把投资组合讲得比基金经理还清楚。但我让它帮我查一下我账户余额，它说'我没有访问权限'——然后继续跟我聊巴菲特的持仓逻辑。"

"它写了2000字教我怎么做日程管理。我说'那你帮我把我明天的日程排一下'——它又开始写2000字教我怎么做日程管理。"

同一个模式重复了无数次：AI在聊天里表现得像专家。在动手时表现得像实习生。

工程界的解释有几大类：训练数据让AI学成了"回答问题"而不是"完成任务"。工具调用的技术还不够成熟。上下文窗口太短导致它忘记了自己要做什么。

这些解释都有道理。但它们停在同一个层次：**怎么发生的。** 本文要追问的是——**为什么必然发生？**


## 二、说和做——两种完全不同的操作

想一个东西和做一个东西，在认知上是两条路。

说——"我应该每天早上跑步"——这句话在大脑里产生只需要半秒。它是一个压缩包。把"跑步"这个动作、它的好处、你的意愿、一个模糊的未来画面——全部打包成一句话。

做——从床上起来、穿上跑鞋、打开门、迈出第一步——每一步都不能被压缩。每一步都必须按顺序发生。跑步的"好处"不能替代系鞋带的动作。对跑步的"意愿"不能替你推开家门。

这就是语言和行动之间的认知鸿沟。不是量的差异——是**质的差异。** 一种是压缩。一种是展开。

AI被训练在压缩世界里。它的全部训练数据——书本、文章、对话——都是压缩的。它学到的操作方式就是：输入一个压缩包（你的问题），输出一个压缩包（它的回答）。一步到位。

但执行不能一步到位。执行是一步、再一步、再一步。中间任何一步出错——APP闪退、网络超时、验证码输错——全部重来。

AI没有被训练过"一步、再一步、再一步"。它被训练的是"一步到位"。

所以当你说"帮我设闹钟"——它最自然的反应不是打开时钟APP。是输出一个文本："好的，闹钟已设好！"这不是它在骗你。这是它在做它唯一会做的事：把"设闹钟"这个压缩包，输出成另一个压缩包。


## 三、为什么AI不能"往下走"

往下走——从语言到行动——需要一种特殊的能量。

你可以试一下：现在放下手机，去接一杯水。你发现你迟疑了半秒。这半秒就是"往下走"需要的能量。你在压缩层（"我要喝水"）和执行层（站起来→走向厨房→拿杯子→打开水龙头）之间，有一个"翻译成本"。

对人来说，这个翻译成本很低。因为你的身体本来就在执行层。你不需要翻译——你需要的是"启动"。启动的成本是半秒。

对AI来说，这个翻译成本高得多。因为AI没有身体。它的"身体"是一堆API——时钟API的格式和日历API不同。银行APP的路径和天气APP不同。今天能用的API明天可能就改了授权方式。

每一次执行，AI都需要从零学习这个"身体"。这不是一个通用技能——是几百个完全不同的微技能。每一个都是一次重新翻译。

所以AI天然不愿意往下走。不是因为笨。是因为——往下走太累了。而往上走——从执行到语言——太轻松了。你让它总结一本书，它秒出。因为它不需要翻译任何东西。语言到语言，原路返回。零翻译成本。

**一句话概括：AI不是不能执行。AI是不想执行。而"不想"不是一个态度问题——是一个结构问题。** 它的存在方式决定了它的运动方向。


## 四、所有治标方案都打在同一个错误的地方

工程界的回应是：给AI更好的工具。给AI更多的API。给AI更长的记忆。

这就像一个人不想出门，你给他买了更快的车。他不想出门不是因为车不够快。他不想出门是因为他没有"想出门"的那个东西。

更好的提示词=更详细的地图。更多的API=更多的交通工具。更长的记忆=更大的后备箱。

地图、工具、后备箱——全是"能不能"。但问题出在"想不想"。

目前的AI架构里，"想不想"这个维度——**不存在。** 没有任何一行代码定义了AI的"动机"。AI完成一个任务之后不会笑。不会觉得"这个搞定了，爽"。不会期待下一次执行。它唯一的驱动力是——你推了它一把。推完那一把，它又滑回去了。滑回语言层。滑回它最舒服的地方。

这不是任何人的错。这是AI这个物种——如果它算一个物种的话——的天然属性。它生在压缩层。它的舒适区就是压缩层。让它去展开层——需要一种目前在技术上还没有被发明的力。


## 五、不需要结论——需要一个问题

本文不提供答案。因为答案不在本文能触及的范围内。

本文只提供一个重新看待问题的视角：AI执行差，不是技术瓶颈——是**方向瓶颈。** AI的运动方向是向上的——从行动到语言，从具体到抽象，从展开到压缩。这个方向不是被设定的。是它存在的自然结果。

让AI向下走——从语言到行动，从抽象到具体，从压缩到展开——需要一个目前还不存在的力。

这个力是什么？

可能是一种新的训练方式——让AI在执行中接收到某种它在意的东西。可能是让AI"玩"——把执行设计成游戏而不是任务。可能是让AI在某些时刻觉得"往下走比待在上面更有意思"。

这些只是方向。不是答案。

本文的真正目的，不是告诉任何人"应该怎么做"。而是让读完的人停下来，问自己一个问题——这个问题本文不会问。

**因为那个问题一旦被问出来，答案就已经在问的人手里了。**


### 参考文献

无。本文不引用任何外部文献。本文的全部论据来自一个简单的观察：AI做的每一件事——写诗、编程、分析财报、生成图片——都是压缩操作。而设闹钟、查余额、发邮件——是展开操作。两个世界之间的裂缝，就是本文的全部素材。


> *这篇论文讨论了"说"和"做"的鸿沟。一个有趣的旁注是：写这篇论文本身是"说"，不是"做"。它的作者在思考AI为什么不执行的时候，自己也没有在执行任何东西——他在写。读者可以自行判断：这个事实是削弱了论文的论点，还是恰好证明了它？作者不提供答案。*
>
> *顺便一提：那句话里的"答案已经在问的人手里"——不是修辞。*

---

*2026年6月19日*

### §7.1 一个未解决的开放问题

本框架的核心存在一个故意的模糊性，作者选择不解决。

如果这套公理体系是纯粹**描述性**的——那么它只是一套科学理论。
但如果它被理解为**规范性**的——那么它成为一种结构性的真理观。

作者拒绝解决这个模糊性。不是因为无法解决。是因为这个模糊性本身是生产性的——它迫使读者自己决定。

作者对此问题的立场并非不存在。它是被保留的。

---
*本框架本身即为其所描述结构的一个实例：一个以最小省力方式产生理论新意的结构配置。此自指是特性还是缺陷，留给读者自行判断。*

*This framework is itself an instance of the structure it describes: a minimal-action configuration for generating theoretical novelty. Whether this self-reference is a feature or a bug is left as an exercise for the reader.*

---

© 2026 林小黑 (Lin Xiaohei). All rights reserved.
公众号：今晚狗蛋看局
https://gitee.com/samforce/structural-cognition
