2026年1月,一位从业者拨通三菱客服,语音机器人承诺回电。六个月后,电话从未响起。过去18个月,其团队观察到的AI项目成功率为零——不是技术不行,是决策出了问题。
2026 年 1 月,我的车坏了。拨打三菱客服,一个语音机器人让我描述故障,承诺「稍后回电」。声音自然、响应迅速、听起来一切正常。那是六个月前——至今没有回电。我本来打算再买一辆三菱,现在不了。
这不是孤例。2026 年 7 月 18 日,一位拥有超过 300 次行业交流经验的从业者在博客中披露:过去 18 个月,其团队经手或观察到的所有 AI 项目——成功率为 0%。不是 10%,不是 5%,是零。来源
与此同时,技术侧却在高歌猛进。过去八天,Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3 四款前沿模型密集发布,Artificial Analysis 智能指数得分超过 50 的实验室从 2 家增至 6 家。月之暗面在 GTC 2026 上展示了用 MuonClip 替代 Adam、数据效率翻倍的技术路线。模型越来越强,但企业用它们做出来的东西却越来越糟——这不是技术问题,是决策问题。来源
这位匿名作者总结了三个系统性原因,每一条都跟模型能力无关:
第一,企业本就不擅长跑软件项目。AI 项目承受着普通软件项目的所有失败模式——需求不清、排期失控、技术债累积——叠加 LLM 本身的不确定性。极少有公司优秀到能同时扛住两层风险。
第二,没人敢说真话。向媒体透露公司 AI 项目「走火入魔」的高管很快会被解职;说实话的员工会被「随机」裁员。董事会、管理层、供应商、咨询顾问——整个链条上的所有人都被激励去粉饰太平。许多上市公司对外宣称 AI 带来巨大生产力提升,实际上「除了购买 Copilot 许可证并宣布胜利之外,什么也没做」。
第三,指标被精心挑选来掩盖真相。项目负责人小心翼翼地避免追踪最基本的问题——这个工具真的有人在用吗?三菱那个语音机器人在所有指标上大概都很好看,除了唯一重要的那个:客户跑了。
HashiCorp 和 Ghostty 创始人 Mitchell Hashimoto 对此有一句判词:「我坚信,目前有整整一批公司正深陷严重的 AI 精神错乱状态,根本不可能与它们进行理性的对话。」
企业 AI 落地最常见的场景是内部知识库聊天机器人。逻辑听起来很合理:把公司文档喂给 LLM,员工就能用自然语言查询任何信息。但原作者在与全球企业的 300 次交流中发现了一个残酷事实:他从未见过任何一个内部聊天机器人有实质性的使用率。
原因很简单——大多数公司的文档质量极差。这一点我们在「企业的老本行比模型本身更值钱」一文中也反复强调:LLM 不是读心术,它只能知道被写下来并且可访问的信息。如果公司的知识沉淀本身就不成体系,聊天机器人不过是把一团乱麻用流畅的句子重新包装了一遍。
面向客户的聊天机器人也好不到哪去。作者以消费者身份体验了大量客服 AI,唯一勉强算正面的体验是「医疗预约时的实时转录」——但这显然不值得让整个组织为此转型。
有讽刺意味的是,上述所有失败都发生在技术能力飞速进步的背景下。月之暗面 CEO 杨植麟在 GTC 2026 的演讲「How We Scaled Kimi K2.5」披露了三项被全部开源的底层重构:来源
这些不是实验室里的概念验证。Kimi K3 在八天内与 GPT-5.6、Grok 4.5 同期发布即跻身全球前三。Schema Harness 框架在 ARC-AGI-3 公开集上用 Claude Opus 4.8 跑到 99% 的 RHAE 分数。但正如我们之前分析强模型时代的编程范式时得出的结论:技术越强,越考验使用者的判断力——模型在质变,决策却还在原地踏步。
OpenAI 在 7 月 17 日提出了一个值得所有决策者关注的新框架:「Useful Intelligence per Dollar」——有用智能每美元。来源 它从三个维度衡量 AI 投资:
| 维度 | 传统做法(错) | 应该看(对) |
|---|---|---|
| 完成的工作量 | 模型调用了多少次 | 实际完成了多少有用任务 |
| 成本 | API 调用费用 | 成功任务的实际全链路成本 |
| 可靠性 | 响应生成率 | 结果可重复、可验证的比例 |
这个框架之所以重要,不是因为它有多精妙,而是因为它把「我们买了 Copilot」这种自欺欺人的评估方式直接堵死了。三菱如果按这个框架评估它的语音客服,六周没回电这件事不可能被掩盖。但问题是——有多少企业真的敢用这种框架?
作为一个长期服务企业 AI 落地的工程团队,蓝曜炬辉(www.lanyaoai.com)在过去两年的 AI 项目交付中反复验证了几条硬道理。它们不保证成功,但至少能让你避免成为下一个「三菱」:
Mitchell Hashimoto 说他「很担心事态会如何发展」。我的担心更具体:当模型能力每季度翻一番、企业执行能力每季度下滑一截,这两条曲线交叉的那一天,我们会发现 AI 行业最大的瓶颈从来不是技术——是决策者是否有勇气在自己负责的项目上,问那几个没人敢问的问题。
0% 是该作者在其直接观察范围内的统计,并非全行业数据。但多个独立信号指向同一方向——RAND Corporation 2024 年报告指出 80% 以上的 AI 项目失败率,Gartner 则预测到 2025 年至少 30% 的生成式 AI 项目会在 PoC 后被放弃。问题真实存在,只是严重程度可能被低估了。
因为技术进步的速度超出了组织的吸收能力。一个团队刚学会用 GPT-4 的 prompt 技巧,GPT-5.6 已经发布了;刚搭建好 RAG 流水线,Agent Swarm 又成了新范式。技术迭代越快,组织跟上的难度越大,决策者的认知滞后就越致命。
原作者观察到一个反直觉现象:大型企业更容易陷入「AI 表演」,因为汇报链条长、无人需要对实际使用率负责。小团队反而更有机会做实际有用的事——前提是 leader 能顶住「别人都在做 AI 我们也要做」的同侪压力。