#01模型与科学
Google 发布 Gemma 4 QAT 权重,E2B 模型内存占用降至约 1GB
Google DeepMind 发布 Gemma 4 全系模型的量化感知训练(QAT)检查点,同时推出面向移动端的新型量化格式。 新格式结合静态激活、通道量化、定向 2-bit 压缩及 Embedding/KV cache 优化,将 Gemma 4 E2B 模型的内存占用压缩至约 1GB;纯文本版本(不含 Per-Layer Embeddings)低于 1GB。 此次发布覆盖消费级 GPU 的 Q40 格式和移动端定制格式。权重已在 Hugging Face 开放,支持 llama.cpp、Ollama、LiteRT-LM、MLX 等工具链。Unsloth 同步发布适配版本及 KLD 分析报告。官方尚未公布量化后模型的基准测试对比数据。
#02模型与科学
小红书开源 dots.tts,20 亿参数端到端 TTS 在多语言基准中达开源最高
小红书 rednote-hilab 团队开源了 20 亿参数的端到端文本转语音模型 dots.tts,采用全连续、无离散 token 的架构。 主干网络由语义编码器、基于 Qwen2.5-1.5B-Base 初始化的 LLM 和 48 kHz AudioVAE 自回归流匹配声学头组成。 在 Seed-TTS-Eval 测试中,dots.tts 中文和英文词错误率分别为 0.94% 和 1.30%,说话人相似度达 81.0 和 77.1;在 24 语言 MiniMax 多语言基准中平均说话人相似度 83.9,为开源最高。模型提供预训练、自纠正对齐和 MeanFlow 蒸馏等多个版本检查点,推理与微调代码以 Apache 2.0 协议在 GitHub 和 Hugging Face 发布。
#03模型与科学
Anthropic 称 Claude Opus 4.7 在 NMR 氢谱预测上比肩 ChemDraw
Anthropic 发布白皮书,评估未经化学微调的 Claude Opus 4.7 在 NMR 光谱预测与结构解析中的表现。 在 20 个化合物的前向预测测试中,Opus 4.7 氢谱平均误差 ±0.079 ppm,优于 ChemDraw 和 MestReNova;碳谱与 MestReNova 基本持平(±1.37 ppm vs ±1.48 ppm),峰型裂分匹配率和亚峰间距预测均领先。 在 15 道反向结构解析题中,Opus 4.7 对 8 个简单分子全部正确还原,7 个复杂分子在起始原料提示下多数成功。Anthropic 承认评估规模较小,未覆盖 2D NMR 和立体化学,结果应视为参考性而非精确结论。 ---
#04Agent 与工具
Cursor 2.2 推出 Design Mode,支持可视化拖拽修改 UI 并自动更新代码
Cursor 正式推出 Design Mode,允许开发者在内置浏览器中通过拖拽、点选、圈注或语音描述直接修改 UI,Agent 自动更新底层源代码。 系统捕获元素标识和视觉截图作为上下文,支持拖拽重排 DOM 元素、在侧边栏调整组件 props 和样式。 所有改动实时热重载,开发者可在 Agent 处理任务时连续发送后续指令。该功能随 Cursor 2.2 版本发布。
#05Agent 与工具
Google 推出 Agentic RAG 框架,多智能体迭代检索准确率提升 34%
Google Research 与 Google Cloud 联合推出面向企业的 Agentic RAG 框架,核心创新是 Sufficient Context Agent,可评估上下文完整性并触发迭代检索。 该框架采用多智能体架构,包含 Orchestrator、Planner Agent、Query Rewriter、Search Fanout Agent 和 Synthesis Agent。 在 FramesQA 数据集上,相比标准 RAG 准确率最高提升 34%,跨语料库检索准确率达 90.1%,延迟仅增加约 3%。该框架已作为 Gemini Enterprise Agent Platform 的公开预览功能上线。
#06Agent 与工具
阿里巴巴开源 Open Code Review,混合管线与 LLM Agent 代码审查工具
阿里巴巴在 GitHub 开源了内部 AI 代码审查工具 Open Code Review,采用确定性工程管线与 LLM Agent 混合架构。 该工具源自过去两年服务数万名开发者、识别数百万代码缺陷的内部审查助手,能读取 Git diff、完整文件及仓库上下文,生成行级精度的结构化审查评论。 内置针对 NPE、线程安全、XSS、SQL 注入等问题的微调规则集,兼容 OpenAI 与 Anthropic API,支持与 Claude Code 等编程 Agent 集成以及 GitHub Actions、GitLab CI 流程。
#07Agent 与工具
Google Colab CLI 开源,Agent 可直接调用远程 GPU/TPU
Google 推出开源命令行工具 Colab CLI,打通本地终端与远程 Colab 运行时。 开发者及 AI Agent 可通过 colab exec 等命令直接运行本地 Python 脚本和 ML 流水线,零摩擦申请 GPU/TPU 算力。工具包含预打包的 Colab 技能文件以方便 Agent 集成。 官方示例展示了使用 Antigravity Agent 通过 CLI 在 T4 GPU 上对 Gemma 3-1B 进行 QLoRA 微调的完整流程。该项目已在 GitHub 开源,可被 Claude Code、Codex 等 Agent 调用。 ---
#08基础设施与融资
SpaceX S-1 披露 Google 每月 9.2 亿美元租用 11 万张 GPU,总额约 207 亿美元
SpaceX 在最新修订的 S-1 注册声明中披露,与 Google 签署云计算服务协议,Google 将从 2026 年 10 月起至 2029 年 6 月每月支付 9.2 亿美元。 协议涉及 SpaceX 位于 Memphis 的 Colossus 数据中心约 11 万块 NVIDIA GPU 的算力访问权。 协议条款显示,若 SpaceX 未能在 2026 年 9 月 30 日前交付承诺 GPU 数量,Google 可终止协议或按比例减少费用。2026 年 12 月 31 日后双方可提前 90 天通知终止。Google 保留其内容、AI 模型及相关数据的知识产权。此前 SpaceX 已将 Colossus1 数据中心算力出租给 Anthropic。
#09基础设施与融资
Alphabet 完成 850 亿美元股权融资,伯克希尔投入 100 亿美元
Alphabet 宣布完成史上最大规模股权融资,总额达 850 亿美元,其中包括 450 亿美元超额认购的公开增发和 400 亿美元的 ATM 计划。 伯克希尔·哈撒韦承诺投资 100 亿美元。 这笔资金将用于支持 2026 年高达 1900 亿美元的资本支出,加速 AI 基础设施建设。Sundar Pichai 在公告中强调 Google 在 AI、Cloud 和 Waymo 等业务上的领导地位。该消息最初在 Reddit 社区传播。
#10基础设施与融资
多家巨头 AI 预算超支,Uber 四月花完全年编码预算,行业转向成本管控
随着 AI 智能体大规模部署,企业 Token 消耗激增,多家巨头 AI 预算严重超支。 Uber 在 4 月耗尽全年 AI 编码预算,微软收回开发者 Claude Code 许可,Priceline 续约 Cursor 费用上涨 4-5 倍。 Linux Foundation 宣布成立 Tokenomics Foundation,计划 7 月正式推出,目标是制定 Token 计费标准和经济指标。Datadog、Ramp 等厂商及多家初创企业已布局成本监控和智能模型路由工具。行业重心从追求速度转向设置成本护栏。 ---
#11开源与评测
通义实验室开源 PawBench,150 道任务评测智能体底座与框架联合效果
通义实验室开源通用智能体评测基准 PawBench,将底座模型与运行框架纳入同一评测体系。 该基准构建了 150 道任务和 4050 个测试单元的评测集,采用混合自动评分器与 LLM-as-judge 双重评分机制。 评测发现运行框架的校验机制与默认工具可用性对模型最终表现有显著影响。排行榜中 qwen3.6-max-preview 搭配 QwenPaw 框架以 78.9 分位居榜首,claude-opus-4.6 搭配 Hermes 框架以 78.4 分紧随其后。
#12开源与评测
腾讯混元与人大团队开源 PlanningBench,30 余种规划任务评估大模型推理
腾讯混元与中国人民大学团队联合开源 PlanningBench,用于评估和训练大语言模型的复杂规划能力。 该基准将现实规划场景抽象为排班调度、路线规划等 6 大家族、超过 30 种具体任务,首批发布 467 个合成评估实例。 测试发现当前前沿大模型在耦合约束条件下生成完整规划方案的能力有限,但基于该数据的强化学习可显著提升模型在未知任务上的表现。 ---