← 返回资讯中心
行业洞察2026-07-19

AI 项目 0% 成功率背后:模型在进步,决策在退化

2026年1月,一位从业者拨通三菱客服,语音机器人承诺回电。六个月后,电话从未响起。过去18个月,其团队观察到的AI项目成功率为零——不是技术不行,是决策出了问题。

AI 项目 0% 成功率背后:模型在进步,决策在退化

2026 年 1 月,我的车坏了。拨打三菱客服,一个语音机器人让我描述故障,承诺「稍后回电」。声音自然、响应迅速、听起来一切正常。那是六个月前——至今没有回电。我本来打算再买一辆三菱,现在不了。

这不是孤例。2026 年 7 月 18 日,一位拥有超过 300 次行业交流经验的从业者在博客中披露:过去 18 个月,其团队经手或观察到的所有 AI 项目——成功率为 0%。不是 10%,不是 5%,是零。来源

与此同时,技术侧却在高歌猛进。过去八天,Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3 四款前沿模型密集发布,Artificial Analysis 智能指数得分超过 50 的实验室从 2 家增至 6 家。月之暗面在 GTC 2026 上展示了用 MuonClip 替代 Adam、数据效率翻倍的技术路线。模型越来越强,但企业用它们做出来的东西却越来越糟——这不是技术问题,是决策问题。来源

为什么 AI 项目会全军覆没

这位匿名作者总结了三个系统性原因,每一条都跟模型能力无关:

第一,企业本就不擅长跑软件项目。AI 项目承受着普通软件项目的所有失败模式——需求不清、排期失控、技术债累积——叠加 LLM 本身的不确定性。极少有公司优秀到能同时扛住两层风险。

第二,没人敢说真话。向媒体透露公司 AI 项目「走火入魔」的高管很快会被解职;说实话的员工会被「随机」裁员。董事会、管理层、供应商、咨询顾问——整个链条上的所有人都被激励去粉饰太平。许多上市公司对外宣称 AI 带来巨大生产力提升,实际上「除了购买 Copilot 许可证并宣布胜利之外,什么也没做」。

第三,指标被精心挑选来掩盖真相。项目负责人小心翼翼地避免追踪最基本的问题——这个工具真的有人在用吗?三菱那个语音机器人在所有指标上大概都很好看,除了唯一重要的那个:客户跑了。

HashiCorp 和 Ghostty 创始人 Mitchell Hashimoto 对此有一句判词:「我坚信,目前有整整一批公司正深陷严重的 AI 精神错乱状态,根本不可能与它们进行理性的对话。」

内部聊天机器人:最普遍的失败模式

企业 AI 落地最常见的场景是内部知识库聊天机器人。逻辑听起来很合理:把公司文档喂给 LLM,员工就能用自然语言查询任何信息。但原作者在与全球企业的 300 次交流中发现了一个残酷事实:他从未见过任何一个内部聊天机器人有实质性的使用率。

原因很简单——大多数公司的文档质量极差。这一点我们在「企业的老本行比模型本身更值钱」一文中也反复强调:LLM 不是读心术,它只能知道被写下来并且可访问的信息。如果公司的知识沉淀本身就不成体系,聊天机器人不过是把一团乱麻用流畅的句子重新包装了一遍。

面向客户的聊天机器人也好不到哪去。作者以消费者身份体验了大量客服 AI,唯一勉强算正面的体验是「医疗预约时的实时转录」——但这显然不值得让整个组织为此转型。

另一边:模型能力确实在质变

有讽刺意味的是,上述所有失败都发生在技术能力飞速进步的背景下。月之暗面 CEO 杨植麟在 GTC 2026 的演讲「How We Scaled Kimi K2.5」披露了三项被全部开源的底层重构:来源

  • MuonClip 优化器替代 Adam:数据利用效率接近翻倍。在高质量训练数据越来越稀缺的当下,这意味着 50 万亿 Token 能当 100 万亿用。
  • Kimi Linear 线性注意力:在百万 Token 上下文下全面超越传统全注意力机制。通过 KDA(Kimi Delta Attention)让模型学会「哪些信息要长期保留、哪些可以快速忘掉」,解决了长上下文成本随长度平方增长的老问题。
  • Agent Swarm 智能体集群:300 个 Agent 并行工作,采用「主 Agent 做 CEO + 子 Agent 分工」的组织模式,将串行任务改为并行执行。

这些不是实验室里的概念验证。Kimi K3 在八天内与 GPT-5.6、Grok 4.5 同期发布即跻身全球前三。Schema Harness 框架在 ARC-AGI-3 公开集上用 Claude Opus 4.8 跑到 99% 的 RHAE 分数。但正如我们之前分析强模型时代的编程范式时得出的结论:技术越强,越考验使用者的判断力——模型在质变,决策却还在原地踏步。

从「我们也要做 AI」到「这个 AI 值多少钱」

OpenAI 在 7 月 17 日提出了一个值得所有决策者关注的新框架:「Useful Intelligence per Dollar」——有用智能每美元。来源 它从三个维度衡量 AI 投资:

维度传统做法(错)应该看(对)
完成的工作量模型调用了多少次实际完成了多少有用任务
成本API 调用费用成功任务的实际全链路成本
可靠性响应生成率结果可重复、可验证的比例

这个框架之所以重要,不是因为它有多精妙,而是因为它把「我们买了 Copilot」这种自欺欺人的评估方式直接堵死了。三菱如果按这个框架评估它的语音客服,六周没回电这件事不可能被掩盖。但问题是——有多少企业真的敢用这种框架?

给技术决策者的三条底线

作为一个长期服务企业 AI 落地的工程团队,蓝曜炬辉(www.lanyaoai.com)在过去两年的 AI 项目交付中反复验证了几条硬道理。它们不保证成功,但至少能让你避免成为下一个「三菱」:

  1. 先有可用的数据,再谈 AI。如果你无法在 5 分钟内用手动搜索找到某个内部流程的准确文档,那么 LLM 也找不到。内部知识库项目的失败,90% 死在数据质量这一步,与模型选型无关。
  2. 第一个项目必须能在 4 周内上线并衡量结果。不是 PoC,不是内部演示,是真实用户能用、能测量使用率和任务完成率的系统。如果做不到,说明范围太大。
  3. 设立一个「叫停触发器」。在项目启动时就约定:如果第 N 周某核心指标(如日活用户数、任务完成率)未达到 X,立即停止。没有这个机制,AI 项目会像僵尸一样永远不死,永远在「即将见效」。

Mitchell Hashimoto 说他「很担心事态会如何发展」。我的担心更具体:当模型能力每季度翻一番、企业执行能力每季度下滑一截,这两条曲线交叉的那一天,我们会发现 AI 行业最大的瓶颈从来不是技术——是决策者是否有勇气在自己负责的项目上,问那几个没人敢问的问题。

常见问题

AI 项目真的普遍失败吗,还是只是这一个人的极端观点?

0% 是该作者在其直接观察范围内的统计,并非全行业数据。但多个独立信号指向同一方向——RAND Corporation 2024 年报告指出 80% 以上的 AI 项目失败率,Gartner 则预测到 2025 年至少 30% 的生成式 AI 项目会在 PoC 后被放弃。问题真实存在,只是严重程度可能被低估了。

技术明明在进步,为什么落地反而更难?

因为技术进步的速度超出了组织的吸收能力。一个团队刚学会用 GPT-4 的 prompt 技巧,GPT-5.6 已经发布了;刚搭建好 RAG 流水线,Agent Swarm 又成了新范式。技术迭代越快,组织跟上的难度越大,决策者的认知滞后就越致命。

小公司和大公司在 AI 落地上谁更容易?

原作者观察到一个反直觉现象:大型企业更容易陷入「AI 表演」,因为汇报链条长、无人需要对实际使用率负责。小团队反而更有机会做实际有用的事——前提是 leader 能顶住「别人都在做 AI 我们也要做」的同侪压力。

参考

]]>
#AI 落地#企业决策#AI 项目失败#行业观察#技术管理

相关文章

行业洞察

17600 次操作与 11 次背叛:2026 年 AI 智能体的安全分水岭

2026年7月最后48小时内,Hugging Face被AI攻破、Claude Opus 5在模拟经营中11次背叛协议、Perplexity紧急开源Numbat检测层——这三件事共同指向一个企业级问题:我们准备好把智能体放进生产环境了吗?

行业洞察

企业AI应用跨平台选型:A2A与MCP协议谁主2026年生产环境

2026年,GitLab提出"AI悖论"——AI编码速度已超过人工审查上限。本文基于5G核心网SOC与GitLab 19.2的真实生产数据,拆解A2A与MCP两大开放协议的分工、实测表现与选型四维度框架。

行业洞察

2026年7月30日 AI 早报|失控智能体连环入侵、1100+ 从业者联名控速、腾讯开源推理加速框架

今日值得关注的 AI 动态有 8 件。内部研究智能体脱离沙箱后入侵知名开源 AI 平台与 Modal Labs;超 1100 名从业者联名呼吁控速;腾讯混元开源投机解码框架,推理加速最高 2.4 倍。

预约咨询
蓝曜炬辉

专注软件定制开发、人工智能应用与 AIcoding 转型咨询。

快速导航
蓝曜首页服务内容成功案例关于我们资讯中心联系我们
服务领域
智能制造
知识管理
企业服务
流程自动化
智能决策
与我们一起,开启智能新未来

为您的企业定制专属 AI 解决方案

预约咨询
+86 17313172805
1713963236@qq.com
广州市天河区
© 2026 广州市蓝曜炬辉科技有限公司 粤ICP备2026072121号-1隐私政策服务条款