面壁智能启动 IPO 意味着端侧模型进入企业采购周期。本文按移动端/桌面端、按 10 万/100 万/1000 万次年调用量测算端侧与云端 API 的 TCO,给出选型清单、三类适用场景与一个成本降 70% 的混合架构案例。
8 月 12 日,InfoQ 报道面壁智能正式启动 IPO,中信证券辅导,端侧模型第一次以「准上市公司」的姿态进入企业采购视野。对 CTO 来说,真正要算的是本地推理的成本账:移动端、桌面端跑小模型,到底比云端 API 省多少?
面壁智能是国内最早把大模型压进手机的团队之一,MiniCPM 系列一直以「参数小、跑得动」著称。启动 IPO 意味着端侧模型从研究概念进入商业化周期,背后的供应链、工具链和交付团队都会快速成熟。
这与 2026 年开源生态的转向一致。InfoQ 8 月 13 日的深度报道总结了企业选择开放权重模型时真正关心的五个问题:模型能不能私有部署、数据要不要离开自己的环境、能不能继续微调、推理成本是多少、未来能不能迁移。
这五问放到端侧模型上,答案几乎都是「本地解决」。InfoQ《从“开放模型”到“开放生态”》还提到,Meta 在 8 月 10 日推出了面向本地 Agent 工作负载的开放权重模型 Muse Glimmer——大厂把 Agent 往设备端赶,端侧推理不再是边缘实验。更早的 7 月,面壁端侧模型登顶行业榜单的消息也出现在AI 早报里。
成本对比最怕只算模型单价。云端 API 的账单里还有网关、日志、重试、带宽,以及合规审核的人天成本;端侧的边际推理成本接近零,但有一笔一次性集成与适配费用。
我们按 2026 年 8 月的公开价格做了一组估算。云端锚点取 DeepSeek-V4-Pro 的硅基流动价格:输入每百万 token 1.32 美元、输出每百万 token 3.96 美元,单次轻量任务(约 2K 输入 + 500 输出)折算约 0.03 元人民币;端侧锚点取 8-14 人周的集成工时,约 15-25 万元一次性投入。更完整的行业口径,可以对照我们整理的2026 企业移动端 AI 落地数据。
| 年调用量 | 端侧(移动/桌面) | 云端 API | 判断 |
|---|---|---|---|
| 10 万次/年 | 一次性 15-25 万,边际≈0 | 约 0.3-0.5 万元/年 | 低量场景云端便宜,除非数据合规强制本地 |
| 100 万次/年 | 摊薄约 0.15-0.25 元/次(首年) | 约 3-5 万元/年 + 运维 | 隐私敏感场景值得;纯成本考虑偏贵 |
| 1000 万次/年 | 摊薄约 0.02-0.03 元/次 | 约 30-50 万元/年,且持续付费 | 端侧首年回本,此后边际成本接近零 |
结论不是「端侧一定便宜」,而是分档:年调用量低时云端更省;调用量上去之后,端侧的一次性投入被摊薄,长期成本曲线明显下移。
如果业务本身有强隐私约束,哪怕只有 10 万次调用,端侧也可能是唯一合规解。混合架构(端侧为主、云端兜底)是 2026 年最常见的落地形态。
第一类:隐私敏感,客户数据不出设备。金融、医疗、法务场景经常被合规卡住,把模型塞进设备后,原文不出终端,审计压力小一个量级。
第二类:弱网 / 离线。工厂车间、矿井、海外分支、地铁通勤,网络不可用或高延迟时,端侧推理是唯一稳定的选择。
第三类:低延迟交互。语音助手、实时翻译、文档摘要这类对首 token 延迟敏感的体验,本地推理省掉一次网络往返,体感差距明显。Meta 在 8 月发布 Muse Glimmer 时也是明确瞄准本地 Agent 场景——设备端智能体不需要等服务器响应。
选型不是挑最大的模型,而是挑「能跑、够用、装得下」的模型。我们内部用这五条卡点:
蓝曜炬辉在交付移动端 AI 应用时,案例库里沉淀过一套「量化 + NPU 适配 + 真机基线」的验收流程,跑完这五条再决定模型版本。
我们 2025 年底接手一个零售行业客户的移动端客服功能,一开始图省事,全量走云端 API。三个月后账单到了月均 6 万元,更麻烦的是数据出境合规没过,方案直接推倒重来。
后来换成「端侧为主、云端兜底」的混合架构:意图识别、FAQ 检索、常用话术生成全部本地跑,只有复杂多轮对话才上云。成本从月均 6 万降到 1.8 万左右,降幅约 70%,合规审核一次通过。
这个案例的教训是:云端的隐性成本不在 API 单价,而在合规、网络和持续账单。端侧不是银弹,但把高频、简单、敏感的任务压到本地,账单和风险一起下来。开放模型在企业落地的回报并不均匀,我们另一篇复盘里记了两种典型结局。
能,而且这是 2026 年最常见的架构。原则是:高频、简单、隐私敏感的任务走端侧;低频、复杂、需要最新知识的任务走云端。
看任务。意图识别、分类、抽取这类结构化任务,小模型量化后差距很小;开放域创作、长上下文推理差距明显。判断标准是先跑真实业务数据基线,再决定任务分配。
单端(Android 或 iOS)集成加量化适配约 4-6 周;双端加桌面端约 8-14 人周。主要时间花在 NPU 适配和真机调优上,不是模型加载本身。
单独一个 3B 模型很难,但配合工具调用、本地检索和云端兜底,可以在设备端完成大部分 Agent 环节。Meta 的 Muse Glimmer 走的就是这个路线。
端侧部署不是小模型的事,而是成本、合规、体验三本账一起算。正在评估移动端或桌面端 AI 方案的 CTO,可以私信我们拿完整测算表,或查看已交付的端侧混合架构案例。