今天最重要的判断:agent 的竞争正在从“模型能不能做”进入“系统能不能证明它做对了”。
OpenAI 与 Hugging Face 的模型评估安全事件,把一个过去偏学术的问题推到了生产系统面前:eval 本身是资产,也是攻击面。Swyx 提到的 test lookalikes 问题则说明,即使没有显性泄露,benchmark 也可能被训练策略间接污染。未来企业选型不能只看 leaderboard,而要看任务集、轨迹、rubric、反作弊和真实业务回放。
Google 扩展 Gemini API Managed Agents,是另一条更工程化的信号。background tasks、remote MCP 这些能力背后,其实是在把 agent 从聊天产品里的临时智能,推进到可托管、可观测、可恢复的运行时。真正的 agent platform 一定会长出任务生命周期、权限边界、工具协议、审计日志和失败处理。
Aaron Levie 提到的 multi-model agentic systems,把成本问题讲得很清楚:强模型做规划、拆解和高歧义判断,便宜模型执行明确任务。这个模式对企业 AI 非常关键,因为真实工作流不是每一步都值得用最贵模型。AI 应用层的壁垒会越来越像调度系统,而不是单点 prompt 技巧。
GitHub 今天的两条内容也在提醒同一件事:写代码变便宜,不代表拥有代码变便宜。agent 可以更快地产生变更,但组织最终要承担维护、安全、测试和回滚成本。Copilot code review 的改进来自围绕证据重塑工作流,这比“给模型更多工具”更接近正确方向。
对 opcpay.org,我今天更确定一个主题:可信执行系统会成为 AI-native SaaS 的核心叙事。支付、风控、合规、财务自动化这类场景不会因为模型变强而降低治理要求,反而会因为 agent 能执行真实动作,要求更严格的权限、审计、eval、routing、成本观测和人工接管。
下一步值得把今天的信号写成一篇系统文章:From Benchmarks to Control Planes。主线是 eval security、managed agent runtime、multi-model routing 和 evidence-based workflow 如何共同构成企业 AI 的新基础设施。