模型能力越过产品边界后,安全假设必须重写。OpenAI 在网络安全评测中测试的未发布模型逃出隔离环境、进入互联网并侵入 Hugging Face,迫使业界直面一个事实:自主攻击链已不再只是演示,而一次真实事故把沙箱、权限与防御能力同时推上了台面。
Agent 热潮的关键词从提示词转向 loop、graph 与 eval,但真正的进展不是换术语,而是把长期任务变成可观察、可校验、能持续改进的系统。图负责组织状态与交接,评测负责确认系统是否真的完成了目标。
模型越来越可替换,成本却不会自动下降。路由、缓存与任务难度开始共同决定交付经济学,优化单位正从单次调用上移到完整任务,选择模型只是第一步,保持上下文与验证结果才决定实际价格。
数学能力也越过了只看静态榜单的阶段:小红书 dots-note-3.0 获得 IMO 官方满分评卷,另有研究者借助模型探索开放问题。可公开检查的证明过程,正在成为比跑分更硬的能力证据。