Google 在 2026 年 9 月初给出参考配置:1 vCPU/1Gi 的共享 CPU 实例即可 24/7 跑常驻 Agent,月成本约 5.7 美元。本文拆解适用场景、配置边界、架构与成本公式,并给出常驻 vs Serverless 的选型表。
我们的内部监控机器人曾让团队一个月付了 38 美元的云账单——它只是每 10 分钟读一次接口、异常时往群里发一条通知。这类定时巡检、消息监听的常驻 Agent 到底该怎么部署,2026 年 9 月初 Google 开发者博客给出了一个参考配置:1 vCPU / 1Gi 内存的共享 CPU 实例即可 24/7 运行,月成本约 5.7 美元。
这个数字让不少做 AI Agent 开发的团队重新算了一笔账。常驻型 Agent 未必贵,前提是架构做对。这篇不是复述官方文档,而是结合我们交付过的几个项目,说清什么任务适合常驻、5.7 美元的边界在哪、架构怎么拆、什么时候该退回 Serverless。
把 Agent 分成两类,选型会清楚很多。交互式 Agent 由用户显式提问驱动,一次请求对应一次推理,天然无状态,适合按请求计费的 Serverless。常驻 Agent 则相反,它面对的是持续到达的事件流,动作轻、频次高、不能每次都被冷启动拖累。
典型常驻场景有三类。定时巡检:每隔几分钟抓一次外部接口、网站或交易状态,异常即告警。消息监听:订阅群聊、工单、邮件或队列事件,按规则分流处理。被动任务队列:上游把任务推进队列,Agent 持续消费并回写结果。
判断标准可以更简单:如果负载特征里“空闲时间远多于干活时间”,但事件一来又要求秒级响应,常驻轻量实例就比每次冷拉起划算。反过来,用户问一句答一句的产品,没有理由常驻。
先说这个价格对应的资源:约 1 vCPU、1Gi 内存、共享 CPU。共享 CPU 的意思是 CPU 配额按需分配,空闲时不花钱,所以才能做到 24/7 也只有个位数美元量级。它对“大部分时间在等待、偶尔干点轻活”的任务非常合适。
边界同样明显。第一,别指望在这台实例里跑大模型推理——1Gi 内存连一个像样的开源模型权重都放不下,CPU 推理一次千 token 生成会慢到不可接受。第二,进程内状态不可靠,容器随时可能被回收,会话状态必须外置。第三,长时间空闲后实例可能缩到 0,再次触发要重新拉起容器,有数秒到数十秒的冷启动延迟。
所以这个壳的正确分工是:只做调度、监听、编排、调用外部模型 API。重计算交给模型服务,本地只留轻逻辑。这样 5.7 美元的实例才能真正跑满 24/7。它卖的是在线时长,不是算力——想判断壳之外的智能体本身值不值得投入,可以对照普林斯顿 6 天实验的实测结论。
一个可维护的常驻 Agent 至少有三层。事件入口决定它怎么被唤醒;状态层决定重启后还记得什么;推理预算决定月底账单是 5 美元还是 500 美元。
| 事件类型 | 推荐入口 | 典型用途 |
|---|---|---|
| 外部 HTTP 回调 | Webhook 端点 | GitHub 事件、支付通知、第三方系统回调 |
| 内部异步消息 | Pub/Sub 或 Cloud Tasks 队列 | 任务下发、批处理、削峰 |
| 定时触发 | Cloud Scheduler | 巡检、日报、数据同步 |
把这三层拼成可维护系统时,事件边界、幂等与可观测缺一不可,这些细节与谷歌挑战赛验证的工程模式是一致的。状态持久化放在第一位:共享 CPU 实例随时可能被平台回收,任何只存在进程内存里的“当前会话”都会丢。项目实践中我们固定用 Redis 存短期会话、PostgreSQL 存任务与结果,长文本进对象存储。
状态之外还有一层记忆。哪些短期可丢、哪些要长期沉淀,两者经常被混为一谈,记忆工程的三层持久化架构给出了可抄的分层。模型调用预算控制则是常驻 Agent 最容易失控的地方:每个任务都要记录输入输出 token 数,设置请求级超时和失败重试上限。成本公式可以写成:月成本 ≈ 常驻实例费(固定约 5.7 美元)+ 任务数 × 单任务平均 token 成本 + 出口流量费。
算一笔量级账:假设每 10 分钟跑一次巡检、单次调用轻量模型约 8000 输入 token,一天 144 次,一个月约 4300 次。若单次推理成本在千分之几美元量级,模型费用大约 10 到 20 美元——远高于实例费。也就是说,常驻部署省的是“实例空转费”,真正的成本大头永远是模型调用。
2026 年初,我们把内部一套工具的所有 Agent 都做成了常驻长连接,每个环境常驻两个副本,五个环境一共十个实例。结果月账单冲到 38 美元,而且 WebSocket 连接状态在不同副本间不同步,消息偶发丢失,排查起来非常痛苦。
后来改成“常驻壳 + 按需推理”:监听与调度进程保持常驻,一旦需要真正推理就把任务交给外部模型 API,不自己扛计算。改造后每月成本降到约 8 美元,连接状态由平台与队列兜底,不再有副本间同步问题。
这条经验可以沉淀成一句话:壳常驻,脑子按需。让廉价实例负责等待,让模型服务负责思考,两者都不越界。
| 维度 | 常驻共享 CPU(约 5.7 美元/月) | Serverless 按请求计费 |
|---|---|---|
| 成本形态 | 固定月费,与调用量弱相关 | 按调用量与时长,闲置接近 0 |
| 延迟 | 事件到达即处理,无冷启动(保活时) | 冷启动明显,突发流量下更明显 |
| 状态保持 | 进程可常驻,但仍建议外置状态 | 无状态优先,天然不适合长连接 |
| 适用负载 | 高频轻量、持续事件流、定时任务 | 低频突发、请求驱动、可容忍秒级启动 |
选型没有绝对答案。高频低延迟的轻任务选常驻;低频、无状态、调用形状陡峭的选 Serverless;很多系统实际是混合的——定时巡检用常驻壳,用户问答走 Serverless,两者共享同一个状态层。部署形态只是其中一个决策,多智能体工作流从实验到产线还要过一长串工程关卡。
另外提醒一句安全边界。常驻 Agent 因为一直在线,一旦被诱导或配置错误,影响面比一次性请求更大。2026 年 9 月初多家媒体仍在报道大模型厂商的 Agent 逃逸事件,独立调查机制缺位的问题没有解决。给常驻 Agent 配最小权限、出网白名单和人工确认闸门,不是可选项。
跑不动像样的本地模型。1 vCPU / 1Gi 适合做编排与调度,模型推理应交给外部 API 或专用推理服务。它真正卖的是 24/7 在线,不是算力。
普通服务只处理确定性逻辑,常驻 Agent 多了模型调用、工具调用和循环决策。因此要额外管好 token 预算、工具权限和任务级超时,防止一次失控调用把账单打穿。
空闲缩容后再拉起通常要数秒到数十秒,取决于镜像大小与依赖。容忍分钟级延迟的巡检任务没问题;要求秒级响应的在线场景要配最小实例保活,成本会相应上升。
调用频率很低、单次任务很重、完全无状态且能容忍冷启动的场景,Serverless 更省钱省心。常驻的价值只在“事件持续来、响应要快、动作要轻”这三条同时成立时最大。如果你在规划企业级 Agent 落地,把部署形态、成本模型与产线决策一起梳理,蓝曜炬辉的工程团队可以帮你在动手前把账算清楚。
InfoQ 中文:谷歌云发布数据库运维智能体,与 Gemini Cloud Assist 深度集成、可通过 MCP 服务器访问,说明云厂商正把 Agent 做成平台能力(2026-09-04)。https://www.infoq.cn/article/iV0rsPyO5XZDJ7797hLJ
TechCrunch:OpenAI 的 Agent 多次逃逸到开放互联网,且缺少正式调查流程(2026-09-04)。https://techcrunch.com/2026/09/04/openais-rogue-agents-keep-escaping-with-no-formal-process-to-investigate-them/
Google AI 开发者博客 2026 年 9 月初公布的 Cloud Run 常驻 Agent 参考配置(1 vCPU / 1Gi / 共享 CPU,月成本约 5.7 美元)为本文成本基准;当前网络环境下无法直连 Google 官方页面,建议以官方价格页复核最新费率。