#01开放生态与Agent协议
不上道!Anthropic 声称不主张禁令,但是仍然要求设置政策限制
Anthropic CEO Dario Amodei发文称,公司从未主张禁止开放权重模型,也反对美国企业一刀切禁用中国开放权重模型。 这篇声明回应了近期围绕中国开放权重模型的争论:美国部分官员被曝考虑限制美国企业使用中国模型,多家科技公司则联名支持开放权重。Amodei说,保护主义禁令挡不住真正的恶意使用者,也解决不了其最担心的国家安全问题;能力尚未达到危险门槛的开放权重模型,仍然是开发者、研究者和企业可以低成本使用的公共产品。 Anthropic官方声明:公司从未主张禁止开放权重模型 但“不主张禁令”只是这篇文章的第一层。Amodei紧接着提出两类风险。第一类是地缘竞争:他担心所谓“威权国家”训练出超过美国的模型,并用于军事优势和国内压制;在这一层风险里,模型是否开放并不重要,真正要限制的是训练能力。第二类是能力安全:强模型可能被用于网络攻击、生物攻击,也可能出现对齐问题;开放权重一旦发布便难以撤回,使用过程又难以监测,因此被他判定为比闭源模型更难控制。 由此,Anthropic给出的不是禁令,而是三道政策闸门。 第一道是算力。 Amodei主张继续限制向中国出售高性能芯片和芯片制造设备,同时打击走私与规避出口管制的渠道。他的逻辑很直接:只要中国无法获得足够多的先进芯片,就难以在前沿训练规模上超过美国。这项政策并不直接禁止开放权重,却从训练上游决定谁有资格做出足够强的模型。 第二道是蒸馏。 他要求打击“工业级蒸馏”,理由是蒸馏比从头训练节省算力,可以让中国模型在芯片受限的情况下逼近美国前沿水平。文章甚至把中国开放模型与“国家支持的蒸馏行动”绑定起来:开放与否被说成次要问题,真正需要政策干预的是模型能力如何获得。 第三道是强制测试。 Amodei主张所有达到一定能力水平的模型,无论开放还是闭源、来自哪个国家,都必须在发布前接受网络、生物与对齐风险测试;能力较弱的创业公司和学术模型可以豁免。表面上这是一套对开放和闭源一视同仁的规则,但“足够强”的门槛由谁制定、测试由谁执行、未通过会受到什么限制,文章并没有给出完整答案。 ### 作者锐评 这篇文章最该读的不是“不支持禁令”这一句,而是Anthropic如何把问题重新命名:开放权重的风险被写成需要政策闸门的安全问题,闭源模型的风险则被写成可以由厂商和国家机器共同治理的问题。说不禁,不等于不设门槛。芯片出口、蒸馏执法和强制测试叠在一起,决定的仍然是哪些人能训练模型、哪些模型能够发布、谁有资格进入前沿竞争。 更难忽略的是Anthropic自己的另一份声明。2026年2月,Dario Amodei公开表示,Claude已经广泛部署于美国战争部及其他国家安全机构,任务包括情报分析、建模仿真、行动规划和网络行动。Anthropic还曾宣布与美国国防部达成2亿美元合作,用于试验服务国家安全的前沿AI能力,并为美国国家安全客户提供专用Claude Gov模型。 Anthropic称Claude已用于美国战争部及国家安全机构的情报分析、行动规划与网络行动 这就形成了一套对自己极其宽容、对开放生态极其苛刻的安全政治:自家的黑箱模型进入军方和情报体系,被称为“负责任地采用前沿能力”;别人把权重交给公众,却要先面对不可撤回、无法监测和可能被滥用的层层质疑。闭源并不会自动消除军事、网络和权力滥用风险,它只是把这些风险藏进合同、保密系统和厂商承诺里,让外界更难看见。 Anthropic当然可以讨论开放模型的真实风险,但它不能一边把自己的模型送进最缺乏公众监督的国家安全场景,一边把“安全”包装成限制开放竞争的天然理由。它真正主张的不是禁止开放,而是只有在它认可的算力来源、测试机制和政治边界内,开放才被允许存在。所谓不上道,就在这里:把自己的权力当治理,把别人的能力当风险。
#02开放生态与Agent协议
MCP 2026-07-28改为无状态核心,并引入多轮往返请求
Model Context Protocol发布2026-07-28规范,把核心协议从双向有状态连接改为无状态请求响应。 新版取消initialize/initialized握手和Mcp-Session-Id,每个请求自行携带协议版本、客户端身份与能力;方法和工具名进入HTTP标头,普通负载均衡器、网关与WAF可以直接路由和授权。 新版用Multi Round-Trip Requests处理确认、补参数等中途交互,并为工具、提示词与资源列表加入缓存提示。Roots、Sampling、Logging及旧HTTP+SSE传输进入至少12个月的弃用期;TypeScript、Python、Go和C#四套Tier 1 SDK已同步支持新规范。 规范:https://modelcontextprotocol.io/specification/2026-07-28/
#03模型与评测
微软开放两款4B模型Mage-VL与Mage-Flow
微软开放固定4B参数规模的Mage模型家族,分别覆盖图像视频理解与图像生成编辑。 Mage-VL采用从零训练的视觉编码器与Qwen3-4B解码器,利用视频编解码结构筛选视觉区域;官方称视觉token减少超过75%,墙钟推理最高加速3.5倍,并可用同一检查点处理图像、视频和主动流式理解。 Mage-Flow用于文生图和指令式编辑,提供Base、RL-aligned与4步Turbo版本,单一检查点支持512至2048原生分辨率和多种宽高比。官方仓库分别以Apache-2.0开放Mage-VL、以MIT许可证开放Mage-Flow,并提供模型权重与技术报告。 模型:https://huggingface.co/microsoft/Mage-VL 模型:https://huggingface.co/microsoft/Mage-Flow
#04模型与评测
A.X K2以688B总参数、33B激活参数开放权重
SK Telecom开放A.X K2模型权重与技术报告,模型采用688B总参数、33B激活参数的稀疏MoE架构。 每个token激活8个路由专家和1个共享专家,模型含61层;Sparse Gated Attention为每个query选择2048个token,以降低长上下文注意力开销。 A.X K2原生训练到128K上下文,官方给出的vLLM配置支持256K,并提供零样本YaRN扩展测试。模型为纯文本基础模型,采用Apache-2.0许可证开放研究与商业使用;FP8权重约647GiB,加上KV缓存和激活后需预留至少800GiB聚合GPU显存。 代码:https://github.com/SKT-AI/A.X-K2
#05模型与评测
四项主流基准审计发现4.5%至11.8%的题目不能公平计分
一项针对GPQA Diamond、GPQA Extended补集、MMLU-Pro和MMMU-Pro的审计称,4.5%至11.8%的题目存在错误答案、格式缺陷或多个合理答案,不能公平计分。 研究者据此发布四套可直接替换的Clean版本:GPQA Diamond由198题缩至189题,GPQA Extended补集由348题缩至309题,MMLU-Pro由12032题缩至10689题,MMMU-Pro由1730题缩至1526题。 项目同时公开每道被移除题目的记录、置信等级,以及原版与清理版双重评分工具。作者把结果描述为模型辅助并经过校准的审计,并非完整人工认证。 论文:https://doi.org/10.5281/zenodo.21613590
#06开发工具与Agent平台
OpenAI开源Codex Security CLI与TypeScript SDK
OpenAI开源Codex Security命令行工具和TypeScript SDK,用于发现、验证和修复代码漏洞。 工具可以扫描仓库、审查代码变更、跨多次运行跟踪发现,并把安全检查接入CI;快速入口为安装@openai/codex-security后执行登录与扫描命令。 当前版本要求Node.js 22或更高版本、Python 3.10或更高版本,并需要Codex Security访问权限。交互式运行支持ChatGPT登录,CI环境可使用API凭据;扫描历史存放在本地workbench状态目录。 文档:http://learn.chatgpt.com/docs/security/cli
#07开发工具与Agent平台
Gemini Managed Agents新增hooks、预算控制、定时触发与免费层
Google更新Gemini API Managed Agents,默认模型切换为Gemini 3.6 Flash,并允许显式选择3.6 Flash、3.5 Flash或3.5 Flash-Lite。 Environment hooks可以在沙箱每次工具调用前后运行自定义脚本,用于阻止、格式化或审计操作;托管Agent现已向没有启用付费的免费层项目开放。 新版本还加入总token预算上限、按cron计划运行的触发器和Environments API。定时触发器会绑定Agent、环境、提示词与计划,并在多次运行之间复用同一沙箱文件;环境接口可用于恢复、检查和清理沙箱会话。
#08开发工具与Agent平台
Agenta开放可自托管Agent工作区,支持订阅账号与本地模型
开源项目Agenta发布面向个人和团队的Agent工作区,用户可以通过对话创建Agent,并为其配置AGENTS.md、skills、MCP server与独立文件目录。 Agent既可在聊天中运行,也能按计划或应用事件在后台执行;系统保留每次模型、工具调用和Agent配置的追踪与版本历史。 自托管版本支持使用现有Claude或ChatGPT订阅,也可接入本地模型。项目README目前列出的harness包括Claude Code与Pi,并提供工具权限和人工审批设置;早间社区帖提到Codex支持,但当前公开README未列入已支持清单,因此未按已上线功能写入。
#09算力与仿真
AMD与Core Scientific合作,2027年先提供超过500兆瓦容量
AMD与Core Scientific达成AI基础设施合作,AMD将获得最高2.5吉瓦的数据中心容量,用于客户部署AMD AI方案。 首批超过500兆瓦的美国基础设施计划从2027年开始提供,双方还将合作设计物理基础设施,并部署AMD Instinct GPU、EPYC CPU与ROCm软件。 协议允许容量由首批规模扩展至2.5吉瓦。AMD还将在特定商业条件下获得按市场价格购买Core Scientific普通股的认股权证,具体扩建与交付仍属于前瞻计划。
#10算力与仿真
NVIDIA开放医疗机器人GPU原生物理仿真框架
NVIDIA在Isaac for Healthcare中开放Medical Physics Simulation框架,用GPU加速的模拟环境生成解剖数字孪生、器械与组织交互、医学成像和强化学习训练数据。 框架同时提供经典物理解算器与生成式世界模型模拟器,面向腔内介入和外科机器人场景。 首个通用可用组件Endoluminal Simulation Module使用NVIDIA Warp与Newton Physics,以Cosserat杆模拟导管等柔性器械的弯曲、扭转和拉伸,并可通过零拷贝Torch-Warp接口接入Isaac Lab。官方将数据不足、长尾场景与4至7年的开发周期列为医疗机器人面临的主要约束。 ---