Claude Sonnet 5 发布
Anthropic 发布 Claude Sonnet 5,称其为"最具 Agent 能力的 Sonnet"。 Sonnet 5 具备规划能力,可使用浏览器和终端等工具,并在多个维度上较前代有明显提升。 Sonnet 5 的 Agent 能力主要体现在自主规划与工具调用上:模型能够分解复杂任务、使用外部工具获取信息并执行操作。这是 Anthropic 在 Claude 系列中首次将规划与工具使用深度整合进 Sonnet 型号。
AI DAILY / 2026-07-01
今天的头条是 Anthropic 推出 Claude Sonnet 5——迄今最具 Agent 能力的 Sonnet 模型,具备自主规划与工具调用能力。同日,Fable 5 与 Mythos 5 出口管制正式解除,Fable 5 将于次日恢复全球可用;Anthropic 还发布了科研工作台 Claude Science 和 Claude 桌面版 Linux beta。Google DeepMind 同步上线 Nano Banana 2 Lite(4 秒文生图)与 Gemini Omni Flash。硬件侧,Etched 走出隐身模式,首台 AI 推理芯片机架上架并已获超 10 亿美元客户承诺。华为开源 openPangu-2.0-Flash,Cognition 推出 Devin Fusion 混合模型框架。
Anthropic 发布 Claude Sonnet 5,称其为"最具 Agent 能力的 Sonnet"。 Sonnet 5 具备规划能力,可使用浏览器和终端等工具,并在多个维度上较前代有明显提升。 Sonnet 5 的 Agent 能力主要体现在自主规划与工具调用上:模型能够分解复杂任务、使用外部工具获取信息并执行操作。这是 Anthropic 在 Claude 系列中首次将规划与工具使用深度整合进 Sonnet 型号。
Anthropic 宣布已收到美国商务部通知,Fable 5 与 Mythos 5 的出口管制正式解除。 经过与美国政府的一系列沟通后,Fable 5 将于次日恢复全球可用。 此前,Fable 5 与 Mythos 5 因被列入出口管制清单而受限,引发行业对 AI 模型出口政策的广泛讨论。此次解除被视为 Anthropic 与监管层达成建设性沟通的结果,具体管制解除条件未公开。
Google DeepMind 同步发布两款模型:Nano Banana 2 Lite 和 Gemini Omni Flash。 Nano Banana 2 Lite 是迄今最快、最便宜的 Gemini Image 模型,文生图仅需 4 秒;Gemini Omni Flash 在对话式视频编辑、多模态引用与组合输入、真实世界交互等场景表现突出。 两款模型可通过 Interactions API 配合使用:先用 Nano Banana 2 Lite 快速生成图像,再用 Gemini Omni Flash 对其进行多模态分析与编辑。DeepMind 官方博客已提供快速入门指南。
AI 推理芯片公司 Etched 正式走出隐身模式,宣布 A0 流片成功、首台机架已建成,并获得超过 10 亿美元的客户承诺。 Etched 专注于 AI 推理专用芯片,其首款产品针对 Transformer 架构做了深度优化。 据 X 上业内人士描述,Etched 的工程方案包含了极低电压域、集群级容错等创新设计。公司表示已从客户处获得超过 10 亿美元的预订单,首台 AI 推理服务器机架已部署完毕。
华为正式开源基于昇腾 NPU 训练的 openPangu-2.0-Flash 混合专家语言模型,总参数约 92B,激活参数约 6B。 该模型支持 512k 上下文长度,采用 MLA 与 DSA+SWA 独立分层混合架构,并在后训练阶段引入多专项强化学习。 官方称其在通用、推理、代码及 Agent 等能力上表现优异。目前 openPangu-2.0-Flash 的权重及训推算子已上线开源平台,Pro 版本将于后续陆续开源。
Cognition 推出名为 Devin Fusion 的混合模型框架,面向 agentic coding 场景,官方称测试中将 Fable 级别智能成本降低 35%。 该框架现已上线 Devin。 Devin Fusion 基于两个核心设计:一是"sidekick"agent 机制,让较小 agent 与 frontier agent 并行运行,由 frontier agent 负责委派、规划和最终审查;二是会话中途动态路由,可根据任务难度变化在模型间动态切换。 ---
Anthropic 发布 GeneBench-Pro,一个面向生物学研究场景的 Agent 基准测试。 该基准评估 AI Agent 在复杂生物学研究中的导航能力,包括文献检索、实验设计推理、数据分析流程编排等任务。 GeneBench-Pro 与传统的代码或数学基准不同,更侧重于科学研究中的多步骤、跨领域推理能力。Anthropic 认为,生物学是检验 Agent 在开放领域问题解决能力的理想场景。
社区发布 Agents-A1 的 GGUF 量化版本,这是一个基于 Qwen3.5-MoE 架构的 35B Agent 专用模型。 量化版本支持 Blackwell GPU 的 NVFP4 格式,以及 MTP 推测解码,最高可实现 1.22 倍的推理加速。 该模型在 Reddit r/LocalLLaMA 社区引发讨论,用户关注其在本地 Agent 场景中的表现。得益于 MoE 架构,35B 参数规模的实际激活参数更少,适合消费级 GPU 部署。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uk0bwm/
Lenny's Newsletter 发布了对 Claude Sonnet 5 的深度评测,通过 64 次生成测试评估其实际表现。 评测覆盖了编码、写作、推理、Agent 任务等场景,对比了 Sonnet 5 与前代及竞品模型。 评测详细数据和对比结果需阅读原文。 ---
Anthropic 推出面向科研人员的 AI 工作台 Claude Science,整合现有模型与 60 多个科学数据库,提供可复现的代码环境与本地化计算资源管理。 目前已向 macOS 和 Linux 平台的付费用户开启公测。 Claude Science 通过统筹 Agent 调用现有 Claude 模型,连接涵盖基因组学和结构生物学等领域的数据库,能生成包含完整代码与运行记录的可复现产出物。应用支持在本地或实验室集群运行,按需通过 Modal 扩展 GPU 算力,同时内置审查机制。
Anthropic 为 Claude 桌面版推出 Linux beta 版,面向 Ubuntu 和 Debian 系统。 该版本提供与 macOS 和 Windows 一致的 Chat、Cowork 和 Claude Code 体验,支持并行会话与集成终端等功能,面向所有付费订阅用户开放。 由于处于测试阶段,该版本暂不支持 Computer Use 和语音听写。
Google 为 Gemini Spark 推出 macOS 应用,可自动化桌面任务,并新增应用集成与实时主题追踪功能。 Spark 可以跨越聊天窗口处理桌面文件,并即将支持通过手机远程为 Mac 指派多步骤任务。 更新还加入了对 Canva、Dropbox 等应用的支持,并允许用户通过自定义 MCP 接入第三方应用。Gemini Spark for macOS 目前以 Beta 版向美国 Google AI Ultra 订阅者开放。
X Developer Platform 推出两个托管的 MCP 服务器。 X MCP 位于 api.x.com/mcp,需通过开源 xurl mcp 桥接器连接,以用户自身账号权限搜索帖子、查找用户、管理书签、获取趋势和新闻、创建及发布文章;Docs MCP 位于 docs.x.com/mcp,可直接连接搜索和阅读 X API 文档。 X MCP 首次使用需浏览器完成 OAuth2 登录,之后 token 自动缓存并刷新。 ---
audio.cpp 项目发布 VibeVoice 1.5B,在本地设备上实现 4.08 倍实时的语音合成。 该模型可将 90 分钟的播客内容在约 23 分钟内完成合成,较 Python 实现提速 2.86 倍。 VibeVoice 1.5B 基于 C++ 推理框架(audio.cpp),专为本地和边缘设备优化,无需 GPU。这一速度使实时语音合成在消费级硬件上成为可能。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uk7khq/
Meta 开发了一款定制 CXL 2.0 芯片,可将旧 DDR4 服务器内存接入新的 DDR5 服务器,应对硬件成本飙升。 这一方案允许 Meta 在新一代仅支持 DDR5 的服务器中继续使用已有的 DDR4 内存池。 通过 CXL(Compute Express Link)2.0 协议,DDR4 内存被作为扩展内存池接入,不占用主内存通道。社区估算该方案可为大规模数据中心节省可观的硬件更新成本。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1ujzf35/
NVIDIA 在其开发者博客发布"世界-行动模型"(World-Action Models)技术路线图:预训练阶段学习对世界状态的想象,微调阶段转化为具体行动。 这一范式借鉴了世界模型在强化学习中的思路,将其扩展至通用 AI Agent 场景。 博文讨论了从视频、仿真等数据中预训练世界表征的方法,以及如何通过微调使模型输出可执行的动作序列。NVIDIA 还发布了配套的 Nsight 开发工具用于神经重建管线优化。
OpenAI 官方博客分享了排查 ChatGPT 数据基础设施 Rockset 罕见崩溃的过程,确认问题由 Azure 主机硬件故障与 GNU libunwind 中存在 18 年的 Bug 共同导致。 团队利用自动化脚本对过去一年的数据进行大规模 core dump 分析,成功将问题分离为两个独立 Bug。 其一是单个 Azure 物理主机的静默硬件损坏导致栈指针错位,现已将该主机拉黑;其二是开源代码 GNU libunwind 中潜藏 18 年的竞态条件,OpenAI 已通过切换至 libgcc 的 unwinder 修复。 ---
OpenAI 在美国面向 ChatGPT Plus 用户上线个人理财功能。 该功能的具体能力和集成方式未详细公开,但从 X 上 OpenAI 团队成员的发帖来看,涉及个人财务数据的分析与建议。 这是 ChatGPT 从通用助手向垂直领域功能扩展的又一步。当前仅限美国市场,其他地区的上线时间未公布。
OPPO 官宣小布助手正式接入微信 A2A(Agent-to-Agent)协作机制,用户通过语音唤醒后可自动向指定联系人发消息或拨打微信电话。 系统遇到重名联系人可确认后再执行,全程采用双重授权机制保障隐私安全。 该功能由厂商 AI 助手发起指令、微信负责执行并返回结果。据报道,微信该能力已在 OPPO 落地,并正逐步向华为、荣耀、小米、vivo 等厂商开放。 参考资料:https://www.ithome.com/0/946/010.htm
据 The Information 报道,OpenAI 工程师本月早些时候发现新的推理优化方法,将部分现有 AI 模型的推理成本削减一半以上。 该优化已应用于未登录账户的访客 ChatGPT 流量,所需 NVIDIA GPU 数量一度降至仅数百块。 OpenAI 将此视为重要的"秘密武器",甚至不愿向其他员工透露细节,担心泄露后被竞争对手迅速采用。 参考资料:https://www.theinformation.com/articles/openai-found-way-to-cut-inference-costs
据《科创板日报》独家报道,月之暗面已启动新一轮融资,投前估值达 315 亿美元。 接近该公司的机构人士透露,Kimi 在 6 月中旬的 ARR(年度经常性收入)已突破 3 亿美元。 此轮收入增长主要源自模型迭代带动的 API 收入提升,目前 API 收入已占整体收入的七成以上且持续走高。 参考资料:https://mp.weixin.qq.com/s/ZqFQW3U6pWJYkUyc06g8ww
一篇发表于 ResearchGate/arXiv 的新论文利用企业层面数据,得出 AI 并未消灭就业的结论。 研究由 Revelio Labs 等机构合作完成,使用企业级劳动力数据分析 AI 技术对各行业岗位数量的实际影响。 论文发现,虽然某些岗位描述和技能要求发生了变化,但总体就业人数并未因 AI 部署而下降。这与"AI 将大规模替代人工"的常见预测形成了对比。完整数据和方法待论文发布后核实。 参考资料:https://x.com/i/web/status/2072079527568724377 ---