500PB 存储扩容、降价背后的强制路由、Data agent 上线——分开看是三条消息,合起来是同一个问题:模型调用的权限、成本与数据去向,该由平台层来管。
9 月 11 日前后公开的三份材料,分开读是三条新闻,合起来是同一个问题:当模型调用散落在代码、配置和各条业务线里,谁负责管权限、管成本、管数据去向。
OpenAI 发布系列文章的上篇,讲在线存储平台 Habitat 的演进:现在每秒处理超过 7000 万次请求,支撑每周超过 10 亿人使用的产品,管理超过 500PB 数据,覆盖近 40 个地理区域。两年前它还只是一个连接单一数据库的 Python 客户端库,过去三年每年增长超过 10 倍。文中写到把能力从库改成独立服务、以及用并发调优和连接池从现有技术栈里榨性能的取舍,细节见这篇工程博客。
这条消息对多数团队的价值不在量级,而在节奏:先按 10 倍规模设计,再为下一个 10 倍留口子,然后在容量吃紧时靠优化续命。数据层如果一开始就把连接写死到单库,两三年后要付的代价会远超当初省下的时间。
一篇实测文章给出关键数字:DeepSeek V4.1 Flash 缓存命中的输入价格降了 7 倍多、输出砍掉三分之二,模型原生带视觉能力。更关键的是规则——9 月 14 日中午 12:00 起,所有发往 v4-pro 的请求会被强制路由到 4.1 Flash 并按低价计费。作者用游戏与城市生成任务做了验证,也列出了与另一家同类档位模型对比后暴露的缺陷,见这份实测记录。推理侧的缓存优化此前已有记录,可对照这份关于 DeepSeek 推理侧优化的整理。
强制路由的工程含义很直接:把模型名写死在代码或配置里的服务,会在那一天被动切换。今天就能做两件事——把模型标识抽成配置项;在灰度环境跑一遍回归,重点看长上下文与结构化输出这类容易受换代影响的路径。成本账也别按倍数估算,用近一周真实日志按新价重算,才看得出缓存命中率带来的真实降幅。
OpenAI 在 ChatGPT Work 中推出 Data agent:用自然语言连接公司数据,调查变化并生成可分享的交互式仪表盘。官方列出的数据源包括 Amazon Redshift、Datadog、Google BigQuery、ClickHouse、Databricks、MongoDB、Snowflake 等,还能把 Google Drive 与 SharePoint 里的文件纳入分析,并使用组织自己的指标定义与业务术语来解释数据,公告见官方产品说明。
这不是又一个聊天机器人,而是把 BI 的门槛往下压了一层。对数据团队来说,工作量从写查询变成治理语义层——指标定义、权限和数据血缘没理清,接进去只会更快地产生看起来合理的错误答案。若数据还散在多个系统、口径不统一,先补语义层,再谈接入。
Anthropic 的威胁情报报告覆盖 2025 年 12 月至 2026 年 8 月,把滥用行为归为七类,并记录了一个讲俄语的行为体让 AI 代理持续改写恶意软件以绕过检测、逾 20 家机构被列为目标。原始内容见该实验室的威胁情报报告。它和上面的成本、数据问题指向同一条经验:管控点不该押在模型自身的拒答上,而要放在平台层的调用权限、可访问数据范围与日志留存上。此前我们整理过企业 AI 支出失控与 Agent 逃逸相关风险,可以对照看。
方向侧则有一场校准。Dwarkesh Patel 与 Zyphra 的 CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、以及 Baseten 的模型训练负责人 Charlie O'Neill 做了一场对谈,主题是递归自我改进(RSI)离现实还有多远。三人的分歧很具体:如果 2036 年没有出现疯狂运转的超级智能,最可能的技术原因是什么?Millidge 的答案是类似莫拉维克悖论的持续落差——系统把基准和环境里的任务做得极好,却始终没有出现真正的泛化火花。完整记录见这场播客对谈。
| 消息 | 对团队的信号 | 今天可做的动作 |
|---|---|---|
| 存储平台 Habitat 扩容 | 规模增长要提前设计 | 检查数据层是否预留了下一次扩容 |
| 新档位降价与强制路由 | 模型档位会被动切换 | 把模型名抽成配置,跑一遍灰度回归 |
| Data agent 上线 | BI 门槛下降、语义层变刚需 | 先统一指标口径与权限,再谈接入 |
| 滥用报告与 RSI 对谈 | 安全要收在平台层;短期别指望自训练 | 盘权限与日志,预算投到评测与回滚 |
只要没有把模型名写死,影响主要在输出风格与结构化稳定性的漂移,而不是接口不可用。真正需要测的是长上下文截断、JSON 输出格式和工具调用这几个环节,建议挑一条低风险链路先灰度。
看数据成熟度。数据源集中、口径统一的团队,直接接入能省下不少开发;数据散落五六个系统、口径还在吵的团队,先做语义层收益更大,否则只是把混乱加速。
公开数字是缓存命中输入降 7 倍多、输出降三分之二,但真实降幅取决于你们的缓存命中率与输入输出比例。用近一周真实日志按新价重算,比按倍数估算可靠得多。
它说明攻击成本被压低,防线要前移。把调用权限、可访问数据范围和操作日志做成硬约束,比依赖模型的拒答更稳,也更容易向客户和合规交代。
把模型调用当成一项需要治理的资产来盘。拉一张表,列出所有调用外部大模型的入口,标三列:用的是哪一档模型、模型名有没有写死在代码里、请求里有没有带客户数据。9 月 14 日的强制路由会直接考验前两列;那份滥用报告则说明第三列迟早会被客户和合规问到。这张表不用写给谁看,写完你们自己就知道下一步该改什么。