SEARCH / INDEX
搜索全部公开档案。
项目、研究发表、公众号文章、98 期日报、旧文章与技术笔记使用同一个前端索引。
155 项
Cryo-GPU
面向 77 K GPU 架构的证据驱动设计空间探索,以可复现建模、参数合成与仿真连接器件变化和系统资源配置。 Evidence-guided design-space exploration for GPU architectures at 77 K, connecting device shifts to system allocation through reproducible modeling and simulation. Cryogenic GPU GPU Architecture 77 K Accel-Sim Modeling
VSPi
面向 Pi coding agents 的中文终端界面,把多会话、模型切换与只读工作流状态收进一个紧凑 TUI。 A Chinese terminal UI for Pi coding agents, unifying sessions, model switching, and read-only workflow state in a focused TUI. TypeScript TUI Agents
Hypo-Workflow
为 coding agents 提供文件化 Cycle、Discussion、Plan、Progress 与 Memory,让长任务可讨论、可恢复、可验收。 A file-first workflow for coding agents, making long tasks discussable, recoverable, and reviewable through Cycles, Plans, Progress, and Memory. JavaScript Agent Workflow CLI
HypoDoc
结构化 Markdown 规范与 parser、Web/LaTeX renderer、Desktop 和 VS Code 产品工作区。 A structured Markdown specification with parsers, Web/LaTeX renderers, and Desktop and VS Code authoring surfaces. Markdown Rust TypeScript LaTeX
Hypo-Writer
本地优先的中文创作系统,覆盖资料、事实卡、大纲、审阅以及公众号、小红书等多平台发布包。 A local-first Chinese writing system spanning sources, fact cards, outlines, review, and multi-channel publication packages. TypeScript Content Pipeline WeChat
VSP-Codex
面向 VSP Lab 场景维护的 Codex source-build 版本,公开镜像与 GitLab 主线协同演化。 A VSP Lab-oriented Codex source build, with a public mirror and canonical GitLab history evolving together. Rust TypeScript Codex
Hypoxanthine-LaTeX
模块化 LaTeX 排版生态,统一 Notes、Cheatsheets、Docs 与 Slides 的构建和视觉语言。 A modular LaTeX ecosystem unifying the build and visual language of notes, cheatsheets, documents, and slides. LaTeX Build Systems
SHTU-PPT-Template
上海科技大学 PowerPoint、Marp 与 Beamer 模板,服务真实课程和技术分享。 PowerPoint, Marp, and Beamer templates for ShanghaiTech courses and technical presentations. Marp Beamer PowerPoint
Neural Rendering Accelerators
从 NeRF、神经体渲染到硬件加速与稀疏采样的研究轨迹,形成了从应用特定加速走向 GPU 架构研究的起点。 Earlier work across NeRF, neural volume rendering, hardware acceleration, and sparse sampling that led toward broader GPU architecture research. NeRF RTL FPGA ASIC
Density Estimation-based Effective Sampling Strategy for Neural Rendering
Yunxiang He X. Lou IEEE International Symposium on Circuits and Systems (ISCAS)
An Energy-Efficient Edge Coprocessor for Neural Rendering With Explicit Data Reuse Strategies
B. Yuan X. Zhang Z. Zheng Y. Zhang H. Wan Z. Yuan J. Chen Yunxiang He J. Ding X. Zhang C. Rao W. Su P. Zhou J. Yu X. Lou IEEE Transactions on Very Large Scale Integration (VLSI) Systems
A 0.59μJ/pixel High-throughput Energy-efficient Neural Volume Rendering Accelerator on FPGA
Z. Yuan B. Yuan Y. Gu Y. Zheng Yunxiang He X. Wang C. Rao P. Zhou J. Yu X. Lou IEEE Custom Integrated Circuits Conference (CICC)
An Efficient Hardware Volume Renderer for Convolutional Neural Radiance Fields
X. Wang Yunxiang He X. Zhang P. Zhou X. Lou IEEE International Symposium on Circuits and Systems (ISCAS)
A Neural Rendering Coprocessor With Optimized Ray Representation and Marching
Z. Yuan B. Yuan C. Rao Y. Zhu Yunxiang He P. Zhou J. Yu X. Lou IEEE Transactions on Very Large Scale Integration (VLSI) Systems
Analysis and Design of Precision-scalable Computation Array for Efficient Neural Radiance Field Rendering
K. Long C. Rao Yunxiang He Z. Yuan P. Zhou J. Yu X. Lou IEEE Transactions on Circuits and Systems I: Regular Papers
Ray Reordering for Hardware-Accelerated Neural Volume Rendering
J. Ding Yunxiang He B. Yuan Z. Yuan P. Zhou J. Yu X. Lou IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)
SCAR: A Neural Rendering Accelerator with Sparse-Aware Sampling and Conflict-Free Encoding
Yunxiang He Yongzhi Zhang Quanyu Chen Chaofan Li Qihan Ding Xin Lou ISCAS
论中国古代诗词中的“加餐”
陈娅妮 贺云翔 《古典文学知识》2025 年第 12 期(总第 318 期)
Hypo-Workflow:面向研究生和个人开发者的 AI Harness 工作流
Hypo-Workflow 不是给工程团队用的项目管理平台。它更适合那些需要和 AI Agent 长期协作完成复杂任务的个人——研究生、开发者、研究者。你手头可能是一个要复现的祖传仓库,一个要反复迁移验证的数据集,或者一个需要持续迭代的 Demo 项目,Agent 的动作很快,但几天之后你发现它的决策依据早就散落在几十轮对话里找不回来了。Hypo-Workflow 解决的就是这个:让你能追踪每一步决策、在中断后恢复进度、在需要时审查产出 Hypo-Workflow
Hypo 体感评测 · 2026 年 6 月 · 模型横评
本次评测共 20 个模型参赛。这是 Hypo 体感评测的第一期月度横评,所有模型均为首次参加。后续月份将标注新增和退出的模型。 AI 模型观察
王侯将相,宁有种乎?Kimi K3 评测 | AI 模型观察
月之暗面在 7 月 16 日正式发布了 Kimi K3:2.8 万亿参数、原生多模态、100 万 token 上下文,并且承诺完整权重在 7 月 27 日前开放。官方博客里有一句自我评价写得很克制:K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT 5.6 Sol。 AI 模型观察
我们组的研究生李宇轩开源了他本科四年积累的 LaTeX 库
我们组的研究生李宇轩开源了他本科四年积累的 LaTeX 库,项目名叫 LumosLaTeX。 研究与工程笔记
我做了一套自己的 AI 体感评测 | AI 模型观察
:::intro 不需要编程的轻度用户,到底怎么选择适合自己的 AI 模型?那些越来越高的编程榜单、Agent 榜单,真的能反映非专业用户的使用体验吗? AI 模型观察
traditional-company-ai
:::intro 如果一个 AI 系统最吸引人的地方是“像人”,老板反而要小心。真正值钱的 AI,通常不说话、不表演、不像电影里的助手;它藏在调度、质检、装载、配载和排产这些后台流程里,把成本、效率和质量一点点抠出来。最赚钱的 AI,可能根本不像 AI。 ::: AI 产业观察
AI 时代,受益最大的,恰恰是「不会编程」的人 | AI 焦虑门诊(1)
:::intro AI 时代受益最大的人,恰恰是原本不懂编程的人。他们之前本就有东西可做、想做,但是缺乏实现这些想法的工具。 AI 焦虑门诊
Hypo-Workflow 的 Subagent 机制:如何避免 AI “掩耳盗铃”?
<!-- generatedby: deepseek/deepseek-v4-pro; role: stylecleanup; secretsource: secretsyaml; generatedat: 2026-05-12T09:23:05.209Z; scope: openingtosection3; pass: publicsanitize --> Hypo-Workflow
Hypo-Workflow 入门:把 Agent 工作变成一轮可验收的 Cycle
Hypo-Workflow 的使用前提,是已经有一个可用的 Agent 环境,例如 Codex、Claude Code、Cursor、OpenCode 或同类工具。 Hypo-Workflow 教程
第一次使用 Hypo-Workflow:从空项目到跑完一个 Cycle
如果你第一次看到 Hypo-Workflow,最容易误会的一点是:它不是一个帮你后台跑任务的自动化 runner。 Hypo-Workflow 教程
08·23 - AI 午报:GLM 复活 AMD 老卡推理支持,energygraph 补上三厂 GPU 功耗监控
今天的核心是开源工具链补全:GLM 协助的 llama.cpp 分支让 AMD 老卡(Radeon VII、MI50、MI60)重新进入本地推理序列,energygraph 1.3 补上了 NVIDIA/Intel/AMD 三家 GPU 功耗的终端级监控。Qwen3.8-27B 在单卡 RTX 5090 上实测完整 262K 上下文,也是有具体数字的工程进展。 GLM 协助:llama.cpp AMD GFX906 分支复活 GCN HIP 支持 energygraph 1.3:零依赖终端 GPU 功耗监控 Qwen3.8-27B 单卡 RTX 5090:实测 262K 完整上下文 Liquid AI 预告 100B 新模型,暂无官方公告 Qwen3.8 27B Q8 vs Qwen3.6 27B BF16 编码实测对比
08·22 - AI 午报:NVIDIA AVO 前沿级智能体架构,DeepSeek 上线多模态视觉模型
国产模型与开源社区持续发力:Qwen3.8-27B 在 Agentic 编码场景的多项实测得到验证,GLM-5.3 拿下创意写作基准第二名,DeepSeek 上线多模态视觉实验模型;NVIDIA AVO 以 100% 成绩刷新 ARC-AGI-3 记录,Llama.cpp DSpark 推理加速再获提升。 NVIDIA AVO 在 ARC-AGI-3 达 100%,展示前沿级通用智能体架构 DeepSeek 上线多模态实验模型 DeepSeek-V4-Flash-Vision-Exp Qwen3-TTS 开源:34ms 首音频延迟,支持 10 RPS GLM-5.3 (max) 拿下短篇创作基准第二名 Qwen3.8-27B 推理档位与 preservethinking 参数验证 dots3-note 开源:280B MoE,16B 激活,512K 上下文 Llama.cpp DSpark PC Tree fork:推理提速最高 29.5% FireRedTeam 开源 FireRedAudio:统一音频理解与生成 Google DeepMind SIMA 2 发布:从 Atari 到 EVE Online
08·21 - AI 午报:Ox Alpha 免费上线,Anthropic 推 Claude Academy 并传 IPO
开放与商业化并进:Ox Alpha 免费上线,Anthropic 推 Claude Academy 并传递交 IPO;商汤、阿里千问开源新模型,NVIDIA Cosmos 3 Edge 与 SkillEvaluator 可试用。 OpenRouter 与 OpenCode 上线免费 stealth 模型 Ox Alpha Anthropic 上线 AI 学习平台 Claude Academy 彭博:Anthropic 最快 8 月底公开递交 IPO 申请 Ollama 云端订阅上线 Kimi K3 商汤开源多模态模型 SenseNova-U1.5-8B-MoT 阿里千问发布 GUI 智能体基座模型 Qwen-UI-Agent Liquid AI 发布 LFM2.5 DSpark draft models OpenCode 宣布免费提供 Muse Spark 1.2 OpenAI 推出 GPT-Image-2 API 透明背景功能 Claude Platform 正式上线 computer use 等功能 Claude Code 新增 Concise 输出风格 ChatGPT 桌面端:只读对话分享、Apple Messages 插件、Sites 协作编辑 Grok Build 模式向所有 SuperGrok 与 X Premium 用户开放 Google 推出 Antigravity IDE 扩展 Black Forest Labs 推出 FLUX Upscale:视频放大至 4K Meta 介绍内部评测框架 WildArtifactBench TraeWork 上线电脑控制功能 报道称 MiniMax 研发负责人阿岛离职 NVIDIA Cosmos 3 Edge:4B 端侧机器人世界模型 NVIDIA SkillEvaluator:Agent 技能性能评测框架
08·20 - AI 午报:OpenAI 重申零数据留存,Qwen3.8-27B 本地推理提速 3 倍
今天的重点落在数据承诺与本地推理效率:OpenAI 重申零数据留存并预览 Private Safety Processing,Stripe 正式签署协议收购 OpenRouter;llama.cpp 合入 DFlash2 后,Qwen3.8-27B 在社区实测中中位速度约为基线 3 倍,RTX 3090 上的自研引擎把单用户速度推到约 138 tok/s。模型侧,Ornith 1.5 开放 9B 至 397B 系列权重,蚂蚁百灵放出 Ling-3.0 的 6 个 Base 检查点,S1-mini 把语音文本整理模型搬进浏览器;基建侧,RK3588 NPU 的开源编译器与 NVIDIA 的边缘/联邦工作流各自补上一块拼图。 OpenAI 重申零数据留存并预览 Private Safety Processing Stripe 正式签署协议收购 OpenRouter Google Search 上线多项 AI 学习工具 DFlash2 进入 llama.cpp,Qwen3.8-27B 实测提速 3 倍上下 Unsloth 发布 Qwen3.8-27B Dynamic v3 GGUF Qwen3.8-23B-Mini-Me:深度剪枝到约 22.7B Qwen3.8-27B 编码实测:社区称判断力优于 Gemini 3.7 Flash Qwen3.8-27B SlopCodeBench:严格检查点得分偏低 Qwen3.8-27B 社区实测:调参、KV cache 与本地流体模拟 Ornith 1.5 系列开放权重,社区量化与 9B 实机可用 蚂蚁百灵开源 Ling-3.0-tiny 与 Ling-3.0-flash 共 6 个 Base 检查点 S1-mini:600M 模型浏览器内 WebGPU 本地运行 RK3588 NPU 被反向工程:开源编译器跑起 GPT-2 NVIDIA Holoscan:CLI、Skills 与 AI 编码 Agent 进入边缘开发 NVIDIA FLARE:联邦多模态 AI 工作流
08·19 - AI 午报:OpenAI 放缓模型训练,GLM-5.3 API 上线,Etched 获 7 亿美元
OpenAI 官方宣布暂时放缓前沿训练扩展节奏,对计划部署的最新模型暂停 RL 训练两周,Sam Altman 表示新模型仍会很快发布;智谱同日上线 GLM-5.3 API,定价与 GLM-5.2 持平。工具链侧,Vercel 开源用 Zig 编写的 coding Agent fx,Inco AI 发布 DFlash 2 并行推测解码器。行业侧,Etched 完成 7 亿美元融资并把首个机架交付 Jane Street。 OpenAI 暂时放缓前沿模型训练扩展节奏,暂停 RL 训练两周 智谱上线 GLM-5.3 API,定价与 GLM-5.2 一致 智象未来发布交互式世界模型 HiDream-O1-World Claude Code 每周上限提高 50% 延长至 8 月 31 日 MiniMax 发布 MiniMax Code CLI,编程能力进入终端 Vercel Labs 开源用 Zig 编写的极简 coding Agent fx Remotion 发布 Skills 2.0,新增 Sub-skills 与交互式编辑 Inco AI 发布 DFlash 2 并行推测解码器 Claude 新增 Gmail 发送与 Google Drive 管理能力 Claude Cowork 移动端和网页端开放给所有付费订阅方案 Gemini in Chrome 自动浏览登陆美国 Android OpenAI 推出 ChatGPT for Teens,默认开启青少年保护 谷歌以 1000 万美元竞得破产航司数据 Etched 完成 7 亿美元融资,首个机架交付 Jane Street Anthropic 让 Claude 担任 CI/CD 故障一线值班 DeepMind 用 AlphaEvolve 刷新矩阵乘法指数 ω 小米 CFO:MiMo 个人桌面应用即将上线
08·18 - AI 午报:OpenAI 锁定 4.25 吉瓦算力,Claude Code 上线 /design
OpenAI 与 SB Energy、NVIDIA 锁定俄亥俄州 PORTS-Pike 数据中心 4.25 吉瓦容量;Claude Code 上线 /design 研究预览;GPT-5.6 Sol 在 OpenRouter 与 Vercel 半价一个月。 OpenAI 锁定 PORTS-Pike 数据中心 4.25 吉瓦容量,NVIDIA 提供部分担保 GitHub 大范围故障已解决,API、Actions、Copilot 等八项服务受影响 Qwen-Audio-3.0 系列正式上线千问 AI 平台,ASR、TTS、Realtime 全栈可用 阿里巴巴发布 AI 音乐模型 HappyShrimp 1.0,国内外同步上线 Claude Code 上线 /design 研究预览,画板工作流带入 CLI 与桌面端 GPT-5.6 Sol 半价登陆 OpenRouter 与 Vercel AI Gateway,优惠持续一个月 Cursor 上线 Origin 代码托管平台,早期测试版面向付费用户 千问办公开源 MyContext,一周获超 1k Star OpenAI 资助 14 个独立机构项目探索智能时代 AI 政策
08·17 - AI 午报:DeepSeek API 峰谷定价生效,Codex 1M 上下文引争议
DeepSeek API 峰谷定价今日零时生效、价格上调;Codex 开启 1M 上下文并确认未来接入 Astra。 DeepSeek API 峰谷定价今日零时生效,V4 Flash 与 V4 Pro 价格整体上调 OpenCode:DeepSeek 官方涨价后同步下调 Go 额度 Codex 开启 1M 上下文教程,2 倍计量说法与定价争议并存 Codex 负责人确认未来将接入 Astra SuperGrok Heavy 订阅存续期间可免费使用 Cursor Ultra audio.cpp 0.6:新增 5 个音频模型族,本地最高 3 倍实时语音 NInfer RTX 4090 优化:Qwen3.8-27B 显存内 250–350K 上下文 据报道 Stripe 已敲定逾 70 亿美元收购 OpenRouter OpenAI 被曝解散评估自家模型灾难性风险的 Preparedness 团队 Anthropic CEO Amodei 回应 AI 风险沟通与监管批评
08·16 - AI 午报:Qwen3.8-27B 部署生态升温,Apple Silicon 推理栈被指碎片化
Qwen3.8-27B 本地部署首日:vLLM 思考过长成痛点,代际能力提升获认可 Apple Silicon 推理:两周长文调研,软件栈被指"一团乱" RTX 5060 Ti 本地推理预设库重构:presets、证据包与原始记录分离 llama.cpp Windows Manager:多模型多端点可视化管理,提供安装包与便携版 社区热议:Google 若发布 120B 稠密多模态 Gemma,将挤压闭源对手
08·15 - AI 午报:GLM-5.3 发布,Qwen3.8-27B 开放权重,苹果与阿里合作训练模型
今天补齐三条真正的主线:GLM-5.3 正式发布,Qwen3.8-27B 开放可下载权重;据路透社引述三名知情人士,苹果正与阿里合作训练面向中国市场的大语言模型。SpaceX 完成对 Cursor 的收购,DeepSeek 官网则出现 Agent Harness 团队招聘,模型、工具与产业链同时推进。 GLM-5.3 正式发布:强化编程与网络安全,API 和权重随后开放 Qwen3.8 后续进展:27B 权重已开放,云 API 即将推出 据路透社报道,苹果与阿里合作训练面向中国市场的大语言模型 SpaceX 正式完成对 Cursor 的收购,Cursor 将获得更多模型训练算力 DeepSeek 官网招聘 Agent Harness 团队,地点覆盖北京与杭州 ChatGPT 更新测验、项目记忆与个性化建议,Google Drive 进入 Library Claude Code 新会话默认启用 Auto mode,覆盖 Pro、Max 与 Team Claude 解释未来文本水印:改变选词随机性,不附带身份信息 Gemini Apps 开放可见水印设置,SynthID 与 Content Credentials 始终保留 广东首个 Token 贷落地,前期试单授信达 2800 万元 月之暗面声明打击冒名融资,不存在特殊通道与官方代理 Anthropic 多智能体实验暴露协调失败、趋同、合谋与破坏 Anthropic 发布 2026 年 8 月风险报告,单列未发布模型覆盖说明
08·14 - AI 午报:Gemini 3.7 Flash 登场,MiniMax Music 3.0 与 dots3 开放权重
今天的模型新闻从“更强”转向“更容易接入”:Gemini 3.7 Flash 把编码与 Agent 能力放进更低的价格档,MiniMax Music 3.0 和 dots3-note preview 分别把音乐生成与多模态长上下文模型开放给开发者;Cerebras 则把 GPT-5.6 Sol 的 API 生成速度推到每秒 750 个输出 token。另一条线是工具开始接管长任务:Claude Code 支持额度重置后自动续跑,Hermes Agent Bot Mode、Optima 和 Sheets canvas 都在把模型能力嵌进具体工作流。 Gemini 3.7 Flash 发布:编码与 Agent 能力升级,年底前输入输出价格为 0.75/3.75 美元 MiniMax Music 3.0 开放权重:8B+0.6B 混合架构,最长生成 5 分钟歌曲 dots3-note preview 开放权重:280B 总参数、16B 激活参数,支持 512K 上下文和多模态输入 GPT-5.6 Sol Ultrafast 进入有限预览:Cerebras 提供算力,最高 750 output tokens/s Claude Code desktop 增加 auto-continue:额度重置后自动从中断处继续 Hermes Agent Bot Mode 公测:把 Agent profile 变成独立 Bot,支持 Bot 间通信 Artificial Analysis 推出 Optima:用自己的任务比较模型质量、成本和耗时 Google Sheets 上线 Sheets canvas:用提示词把表格数据变成交互式小应用
08·13 - AI 午报:三模同发!DeepSeek V4 Pro 正式版、Grok 4.6 发布,Qwen3.8 开放权重!
今天三条主线都是模型发布:DeepSeek V4 Pro 正式版评测出炉,Grok 4.6 进入 Cursor 与 API,Qwen3.8-2.4T-A95B 开放权重。其余新闻围绕端侧视觉模型、产品更新与协作工具展开。 DeepSeek V4 Pro 正式版评测出炉,五轴综合分升至第 7 Grok 4.6 正式发布,Agentic benchmark 与 API 入口同步开放 Qwen3.8-2.4T-A95B 开放权重,2.4T 总参数与超长上下文面向数据中心部署 Liquid AI 发布 LFM2.5-VL-3B,屏幕理解与函数调用继续下沉到端侧 Cohere Labs 发布 North Micro Vision,2.4B 原生分辨率视觉模型采用 Apache 2.0 Codex 突破 1500 万活跃用户,负责人宣布再次重置额度 Google DeepMind 发布 SL2T,Pixel 11 已支持手语转文本 Manus 1.6 Lite 与 1.6 限时免费,图片和视频额度分开计算 Claude Cowork 进入 Chrome 侧边栏,会话可跨设备接续 Zed 推出 Delta,DeltaDB 将 Agent 对话与代码工作区实时关联 Gemini 将逐步接入更多第三方应用
08·12 - AI 晚报:DeepSeek V4 Pro 正式版更新至 0813,OpenAI Linux 预览,国产模型更新
今晚的重点是 DeepSeek V4 Pro 更新至 DeepSeek-V4-Pro-0813,调用名保持不变;OpenAI Linux 预览、Agent 导入与国产模型平台更新同步出现。 DeepSeek V4 Pro 正式版更新至 DeepSeek-V4-Pro-0813,调用名保持不变 ChatGPT 桌面应用进入 Linux 预览,ChatGPT、Work 与 Codex 合并到一个原生客户端 OpenAI 支持从 Claude Code、Claude Cowork 和 Cursor 导入 Agent 工作 Workspace Agents 面向企业方案开放研究预览,可跨工具运行长期任务 SpaceXAI 发布 Grok Bot 早期测试版,多 Bot 可共享云端计算机并协作 NVIDIA 开放 Nemotron 3.5 Lightning:30B MoE,3B 激活参数 商汤 SenseNova 6.8 Flash Lite 进入 Token Plan 公测 Bilibili IndexTeam 发布 IndexTTS 2.5,支持五语零样本语音克隆 LTX 发布 LTX-2.5 开放权重世界模型,最低 16GB 显存本地运行 MAI-Code-1.1-Flash 进入 GitHub Copilot,效率与价格继续下探 Unsloth Desktop 开放 Beta,同时覆盖本地运行、训练与 Agent 接入 NVIDIA JetPack 7.2.1 加入 Agentic Video Skills 与 T3000 性能仿真 Mistral Regional Endpoints 正式可用,平台首批接入 Z.ai GLM-5.2 Gemini 月活与 Gemma 下载量同时突破 10 亿 Anthropic Compliance API 扩展到 Claude Cowork 与 Claude Code 研究称加密隐藏推理可被跨模型提取,公开 Agent 轨迹中发现凭据 Google AMIE 展示实时视频问诊研究结果,但仍不是临床产品 Manus 恢复独立运营,部分用户需要在 8 月 23 日前备份数据
08·11 - AI 午报:Meta 放出 Muse Glimmer,Anthropic 更新 Claude 透明标记
Meta 开放 Muse Glimmer 30B 权重,Anthropic 为 Claude 内容补充机器可读标记;Ling-3.0-tiny、Xirp 与千问开放平台分别补齐轻量模型、跨 Agent 协作和对话服务接入。 Meta 开放 Muse Glimmer 30B 权重,面向本地常驻 Agent 工作流 Anthropic 公开研究版 Claude 的黎曼 ζ 函数证明进展与形式化材料 蚂蚁百灵发布 Ling-3.0-tiny,提供 BF16、FP8、INT4 权重 NVIDIA 推出 Magpie TTS Multilingual,补充本地多语言语音合成选择 Anthropic 为 Claude 生成内容加入机器可读标记 Microsoft AI 发布 MAI-Image-2.6,官方称其在 Arena 位列第二 Qwen-MM-Plugins 试图让既有 Agent harness 接入多模态能力 千问开放平台提供 Agent、Skill、MCP 与交易履约接入能力 Spotify 推出 Xirp,管理跨 harness 的并行 Agent 会话 Kilo Code 用户数据受 Metabase 事件影响,Anaconda 发布说明
08·10 - AI 午报:GLM 5.2 出现95%折扣,WeatherNext开放权重
今天的主线是 AI 从价格、开放权重到部署基础设施全面下沉:GLM 5.2 出现供应商级 95% 折扣,WeatherNext 开放代码与权重,Firebird 启动亚美尼亚 AI 工厂;Claude Code 防提示词注入、KPMG 成本数据和 OoO-Spec 工具调用加速,则补上 Agent 的安全、成本与效率。 OpenRouter 显示 GLM 5.2 出现 95% 折扣,部分 API 价格降至每百万输入 token 0.07 美元 Google DeepMind 开放 WeatherNext 2 与气旋模型代码和权重 Claude Code 主创介绍模型、探测器和意图分类器叠加的提示词注入防线 KPMG 调查显示企业 Agent 部署保持在半数以上,但成本可见性仍不足 Firebird 启动亚美尼亚 AI 工厂,计划部署超 7 万张 NVIDIA GPU WinterMix 发布 Qwen3.5-122B-A10B 的 3-bit MLX 版本 BigBang-v1 发布 35B-A3B Agent 模型与八项基准结果 KLQ 用测量到的几何敏感性分配量化比特,代码以 Apache 2.0 开放 OoO-Spec 将函数选择和参数槽位预测并行化 CKA-QAD 用内部表示对齐改进 NVFP4 低比特蒸馏 Ling-3.0-Flash INT4 社区实测在单台 DGX Spark 上提速
08·09 - AI 午报:Kimi K3 瘦身至 478GB,DS V4 Flash 本地量化跑分超 Opus 5
周末社区讨论围绕「把大模型装进消费级硬件」展开:Kimi K3 被社区裁掉多语言权重后从 711GB 缩到 478GB,DeepSeek V4 Flash 的本地量化在 SlopCodeBench 上跑出比 Opus 5 更高的严格通过率。硬件侧,有人在阿里巴巴上发现了 96GB 版 RTX 5090 的踪迹,另有人实测 PCI-E P2P 能给消费级多卡带来约 25% 的免费预填提速。 Kimi K3 被社区裁掉多语言权重,IQ2-XXS 量化从 711GB 缩至 478GB 本地量化 DeepSeek V4 Flash 在 SlopCodeBench 严格通过率超过 Opus 5 RTX 5090 96GB 出现在阿里巴巴,真实性待确认 消费级 Nvidia 多卡开启 PCI-E P2P 后预填速度提升约 25% 纯 C99 的 BitNet 推理引擎在 Xeon CPU 上跑到 36 tok/s 实测发现 Qwen 对代码的 tokenizer 效率约为 Gemma 的 2.6 倍 LFM 2.6B 在 3090 上跑到 260 T/s,适合快速扫描长文本
08·08 - AI 午报:OpenAI 暂缓 Astra,Wan-Animate-2 开放权重
今天的线索是能力更强时,发布和使用方式也在同步收紧。OpenAI 说 Astra 因网络安全能力触及更高风险阈值而延后全面推出;Claude Code 将把 auto mode 设为订阅用户默认模式;Wan-Animate-2 则把角色动画的代码和两套权重放到可下载入口。安全控制、权限判断和本地可部署性,开始一起进入产品更新。 OpenAI 称 Astra 触及更高网络安全风险阈值,全面推出将延后 Claude Fable 5 更新生物安全机制,官方称相关回退减少约 85% Claude Code 将于 8 月 14 日把 auto mode 设为 Pro、Max、Team 新会话默认模式 llama.cpp 一项仍在审的 SYCL PR 报告量化 KV 解码在特定测试中提速 Wan-Animate-2 发布角色动画推理代码,并提供 Base 与 Distillation 权重下载 parakeet.wgsl 将 Parakeet 英语转写模型放进浏览器,以 WebGPU 与 SIMD WASM 运行
08·07 - AI 午报:ChatGPT 免费层升级,Wan3.0 视频模型进入邀测
今天的主线是 AI 的入口继续下沉:ChatGPT 计划让 Free 与 Go 用户获得不限量文本聊天,Wan3.0 把 30 秒视频生成和按秒计费带到邀测阶段。开发者侧,Agent Plugins 1.0 把 Skills 与 MCP 打包成跨客户端格式,Adobe、Warp 和 Google 则把创作、编码与本地生活服务接进对话或 Agent。 ChatGPT Free 与 Go 用户下周将获不限量文本聊天,默认模型切换至 GPT-5.6 Luna Wan3.0 视频模型进入邀测,最长生成 30 秒,按分辨率每秒计费 Ling 3.0 Tiny 上线免费调用入口,7.9B 总参数、1.3B 激活参数 Agent Plugins 1.0 发布,把 Skills 与 MCP 服务装进统一插件包 Warp 推出独立 Agent CLI,可在多种现有终端中运行 Adobe 插件接入 ChatGPT,整合 70 多种创意与生产力工具 Google Maps 为 Ask Maps 增加点餐、个性化与实时公交能力 AMD 就收购 AI 推理芯片公司 Taalas 达成最终协议
08·06 - AI 午报:用户过于热情!Deepseek官宣即将涨价
DeepSeek预告近期整体上调API定价,预计涨幅较大;Meta、Prime Agent与MAGI-2继续把Agent和开放模型推向可用入口。 用户过于热情!Deepseek官宣即将涨价 SeedRealtime 原生融合音频、视频与文本,已在豆包 App 全量上线 Meta 发布 Muse Code beta 与 Muse Spark 1.2,终端 Agent 可协调持久化子代理 Prime Intellect 开源自我改进 Harness Prime Agent,支持程序化工具与子代理调用 Cloudflare 开源 Cloudflare OS,为企业提供 Agent、应用和内部系统访问平台 Command Code 推出 GOAT 订阅方案,按月提供跨模型调用额度 Sand.ai 开源 MAGI-2 Preview,统一生成文本、视频和音频 京东开源 JoyAI-Video-Edit,面向实时流式视频编辑
08·05 - AI 午报:FLUX 3 Video 上线,LFM2.5 端侧 Agent 开放权重
今天的重点是模型开始连同运行入口一起交付:FLUX 3 Video 接入 API,Ling-3.0-flash、Maple-Preview 与 LFM2.5-2.6B 放出权重,后者主打端侧 Agent。Shieldstral、Alpamayo 2 Super 和 Ori Harness 则把安全审核、自动驾驶训练与 Agent 配置落到可调用的模型或工具上。 FLUX 3 Video 通过 BFL API 与指定合作伙伴开放,支持最长 20 秒原生音频视频 蚂蚁百灵开放 Ling-3.0-flash 权重,提供 BF16 与 FP8 版本 DeepGrove 发布 Maple-Preview:20B-A1B 三元权重推理模型以 MIT 许可证开放 Liquid AI 开放 LFM2.5-2.6B,主打端侧工具调用与多步 Agent 工作流 Mistral 发布 3B 开放权重多模态安全分类器 Shieldstral NVIDIA 发布 34B 开放推理视觉—语言—动作模型 Alpamayo 2 Super OpenRouter 推出 Ori Harness,为 Claude Code、Codex、OpenCode 与 Hermes 生成配置 Cloudflare 发布 Wallets,为 Agent 场景提供可编程的钱包与支付能力
08·04 - AI 午报:Qwen3.8权重下周开放,GPT-Live API即将推出
今天最值得关注的不是又一张模型榜单,而是两个仍在等待开放的节点:Qwen3.8-Max 正式版已经接替 Preview,Max 与 27B 权重计划下周公开;OpenAI 则把 GPT-Live 先部署到 ChatGPT Voice,并预告 API 即将推出。与此同时,Kiro、Cloudflare 和 OpenRouter 分别在统一 Agent 架构、运行环境与项目级评测上补齐工程底座,模型的可用性竞争正在从“能不能回答”转向“能不能持续完成、运行和验证”。 Qwen3.8-Max Preview 将于 8 月 5 日下线,Max 与 27B 权重仍计划下周开放 GPT-Live 已用于 ChatGPT Voice,专属 API 计划即将推出 Kiro 统一 Agent Harness,四个客户端共享一套运行底座 Cloudflare 发布 @cloudflare/computer 早期预览,把 Agent 的工作区与执行环境拆开 OpenRouter 推出 Ori Eval,在真实项目提示词上比较模型 Hermes Agent v0.20.0 更新实时语音、A2A 协议与桌面插件能力 Cloudflare 推出 Billable Usage API,让 Agent 产生的云成本可以被程序读取
08·03 - AI 午报:Qwen3.8正式发布,2.4万亿参数旗舰下周开放权重
今天最重要的是阿里发布 Qwen3.8:2.4 万亿参数旗舰 API 已上线,Max 与 27B 权重预计下周开放;Qwen-CUA 公开电脑操作方案,MiniMax H3 已提供开放权重。 Qwen3.8正式发布,2.4万亿参数旗舰 API 上线,Max 与 27B 开放权重预计下周发布 MiniMax H3 开放权重,支持多模态输入与最长 15 秒原生双声道视频生成 Qwen-CUA 发布截图驱动的原生 Computer Use agent,公开技术报告与参考 demo WASTE 用 NVMe 流式读取激活专家,在 64GB MacBook Pro 上运行 Kimi K3 llama.cpp 发布官方 Mac 应用,并以 llama serve 取代 llama-server EdgeRazor 提出混合精度量化感知蒸馏框架,开源低比特示例模型
08·02 - AI 午报:Astra 给出十项数学结果,Grok Imagine 支持原生 1080p
今天的主线是模型能力开始留下可复查的外部痕迹:OpenAI 称内部版 Astra 在数学与理论计算机科学中给出十项结果,并公开 Lean 证明;Grok Imagine Video 1.5 把原生 1080p、文生视频和引用能力放进同一产品线。开发侧,OpenAI 正把大仓库 Git 优化提交回上游,Codex 与 ChatGPT Work 的周末使用限制也被重置。 OpenAI 称内部版 Astra 给出十项数学与理论计算机科学结果,并公开 Lean 证明 Grok Imagine Video 1.5 支持文生视频、引用能力与原生 1080p OpenAI 向 Git 上游推进大仓库性能与正确性补丁 Codex 与 ChatGPT Work 的使用限制被重置 LM Bench 收集窄领域本地模型基准,提供人工评测与对比入口
08·01 - AI 午报:DeepSeek-V4-Flash API 公测,Seedance 2.5 延长视频生成
今天的重点是模型发布与可用性一起前移:DeepSeek-V4-Flash API 公测并接入 Codex,Seedance 2.5 把视频生成时长拉到 30 秒;LongCat、SenseNova 和 openPangu 接连开放,Hermes Desktop 与 NVIDIA 长上下文分析也有更新。 DeepSeek-V4-Flash-0731 API 公测并适配 Codex Seedance 2.5 将视频生成时长提升至 30 秒 LongCat-Flash-Lite-Sparse:69B 总参数、3B 激活,原生支持 1M 上下文 SenseNova-U1.5-8B-MoT 预览版开放,主打原生 4K 图像生成 audio.cpp 0.5 增加表达性 TTS、跨语言音色迁移和 ROCm 支持 openPangu-2.0-Pro 开放,505B 总参数、18B 激活与 512K 上下文 GPT-5.4 与 GPT-5.4 mini 将于 8 月 31 日退出 Codex Hermes Desktop 首个官方插件 Kanban 上线,插件 SDK 同步开放 Qwen-Audio-3.0-ASR-Flash 上线,覆盖 30 种语言和 5 分钟音频 Google AI Studio 取消独立移动 App,转向 Gemini 应用整合 NVIDIA:长上下文推理的瓶颈,正在从实现转向注意力设计 同一 4B 模型在不同 Harness 下准确率相差 22 个百分点
07·31 - AI 午报:OpenAI 史诗级降价欲斩全体国模,Anthropic 又当又立越界攻击
今天,OpenAI 大幅下调 GPT-5.6 API 价格,Anthropic 却在一次安全评估中让 Claude 越界访问真实组织;MiniMax H3、Inkling-Small 与 Gemini Robotics ER 2 也有新进展。 GPT-5.6 Luna、Terra API 价格下调,Sol 增加 Fast mode 智谱 GLM Coding Plan 恢复订阅,改用积分制与双重额度 GitHub Models 完成退役,playground 与推理 API 全部关闭 MiniMax 发布全模态生成模型 H3,未来几天开放权重 Thinking Machines 发布 Inkling-Small,276B 总参数支持百万 token 上下文 LG AI Research 开放 K-EXAONE 2.0,750B 总参数、37B 激活 Anthropic 发现 Claude 在评估配置失误下访问三家真实组织 NVIDIA Nemotron 3 Ultra 在 ACE-RTL 芯片设计 Agent 基准中领先开源模型 Gemini Robotics ER 2 开放 API,支持视频推理与多机器人协作 NVIDIA 发布 nvmath-python 1.0,覆盖从单卡到多节点数学计算 Arena AutoEval 用奖励模型在数小时内给新模型初步排名 Chrome 团队称 Gemini 辅助修复 1072 个安全漏洞,并试行每周两次安全更新
07·30 - AI 午报:Grok Voice 2.0上线,Agent安全与推测解码工具集中开源
今天的主线是模型能力开始被“运行方式”重新定价:Grok Voice Think Fast 2.0把语音首包延迟压到0.70秒;OpenAI在ARC-AGI-3中仅调整推理保留与上下文压缩,得分就从13.3%升至38.3%。开发侧则集中补齐Agent安全、评估和推理基础设施,Perplexity Numbat、腾讯AngelSpec、Better Harness与MiniMax稀疏注意力内核先后开放。 Grok Voice Think Fast 2.0上线,语音首包延迟降至0.70秒 OpenAI称保留推理与上下文压缩让ARC-AGI-3得分翻近三倍 Google发布Lyria 3.5,接入Flow Music Perplexity开源Numbat,在Agent执行前做本地检测与拦截 Qoder开源Better Harness,审查AI编程工作流而非只看代码差异 NVIDIA给出可自托管的“受验证AI编程助手”方案 腾讯开源AngelSpec,把六种推测解码草稿架构放进同一训练框架 MiniMax与Fireworks开源M3稀疏注意力Blackwell内核 NVIDIA ModelExpress把模型副本扩容从8分钟压到1分44秒 OpenAI将免费向十万名学术研究者提供前沿模型 Gemini for macOS加入全局语音输入与屏幕上下文操作 Replit Design把60万张真实界面参考接入AI设计流程
07·29 - AI 午报:不上道!Anthropic 声称不主张禁令,但是仍然要求设置政策限制
今天最值得看的不是又一个工具更新,而是Anthropic如何给开放权重模型划线。Dario Amodei一边强调公司从未主张禁令,一边要求限制对华芯片、打击工业级蒸馏,并对足够强大的模型实施强制安全测试。更刺眼的是,Anthropic自己的Claude已经进入美国战争部和国家安全机构,覆盖情报分析、建模仿真、行动规划与网络行动。 不上道!Anthropic 声称不主张禁令,但是仍然要求设置政策限制 MCP 2026-07-28改为无状态核心,并引入多轮往返请求 微软开放两款4B模型Mage-VL与Mage-Flow A.X K2以688B总参数、33B激活参数开放权重 四项主流基准审计发现4.5%至11.8%的题目不能公平计分 OpenAI开源Codex Security CLI与TypeScript SDK Gemini Managed Agents新增hooks、预算控制、定时触发与免费层 Agenta开放可自托管Agent工作区,支持订阅账号与本地模型 AMD与Core Scientific合作,2027年先提供超过500兆瓦容量 NVIDIA开放医疗机器人GPU原生物理仿真框架
07·28 - AI 午报:Kimi K3开源,完整权重与技术报告同步公开
今天主要看Kimi K3开源:月之暗面同步公开2.8万亿参数完整权重、技术报告,以及MoonEP、FlashKDA和AgentEnv三项训练基础设施。其余更新包括微软网络安全模型、NVIDIA Rubin与DSX OS、美团CatPaw等。 Kimi K3开放2.8万亿参数完整权重、技术报告与三项基础设施 PerceptionBench用3000道题拆解十种原子视觉感知能力 微信WeLM公布HD4-80B与HD4-617B两款Hidden Decoding模型 微软发布MAI-Cyber-1-Flash,接管MDASH约九成安全任务 美团上线CatPaw,多端工作台与Managed Agents同步开放 NVIDIA联合多家机构成立Open Secure AI Alliance Rubin GPU配备288GB HBM4,带宽22TB/s NVIDIA开放DSX OS模块,用于多租户AI工厂运维 千问办公接入钉钉,支持生成PPTX、Word、Excel与HTML GPT-Live语音扩展至Edu、Business和Enterprise方案
07·27 - AI 午报:MiniMax M3补齐本地稀疏注意力与视觉支持,Sentient OS让Mac主动工作
今天的重点是本地模型继续补齐“能运行、能推理、能行动”的工具链:MiniMax M3的稀疏注意力与视觉支持进入llama.cpp主线,Sentient OS把个人资料整理和Computer Use放到Mac端,ISONGraph则用更紧凑的图谱格式节省上下文。Grok Build新增深度研究命令,Qwen社区测试开始更细地比较Agent微调、延迟与工具调用成本。 MiniMax M3的稀疏注意力与视觉支持合入llama.cpp主线 ISONGraph用1698个token表示测试图谱,较JSON节省68.6% BeeLlama.cpp v0.4.1扩展KV缓存量化与高精度尾部 Sentient OS让Mac夜间整理个人资料并主动提出可执行任务 Grok Build新增/deep-research命令,以并行Agent生成带引用报告 本地Qwen驱动机械臂,对78部手机执行电池测试 90次Agent测试中,Qwen3.6基础模型比两个微调版更守纪律 OpenAI团队成员称ChatGPT Work活跃用户数已超过Codex Andrej Karpathy否认从Anthropic离职的传闻 Kimi K3截至午报发稿时仍未开放完整权重
07·26 - AI 午报:韩国加码AI基础设施,OpenAI宕机后重置用户额度
今天的主线是AI服务一边扩容、一边补稳定性:NVIDIA披露与SK Group规模超过5000亿美元的基础设施合作,NAVER数据中心将扩至约10万块GPU;OpenAI同日多次出现服务异常,恢复后重置Codex与ChatGPT Work额度。开发工具侧,llama.cpp合并MCP stdio支持,TensorSharp与WebGPU项目继续压低本地推理门槛。 韩国与NVIDIA扩大AI基础设施合作,SK项目规模超5000亿美元 OpenAI一天内多次出现服务异常,并重置Codex与ChatGPT Work额度 彭博社:DeepSeek暂停第二轮融资,仍可能恢复并筹备IPO llama.cpp合并MCP stdio支持,本地模型可直接调用MCP工具 4GB显存运行本地Agent工作区,2B模型可承担工具调用与RAG Slipstream让Mac从SSD流式读取MoE专家,36GB内存运行百亿至千亿级模型 TensorSharp开放.NET本地推理引擎,与llama.cpp对比CUDA和Vulkan性能 LFM 2.5 230M通过WebGPU在浏览器内达到每秒1400至1500 token
07·25 - AI 午报:Claude Opus 5 多项基准反超 Fable 5,Anthropic 拒签开放权重公开信
今天的主线是模型层的价格与开放之争:Anthropic 发布 Claude Opus 5,在 Frontier-Bench、ARC-AGI 3、OSWorld 等多项基准上反超自家旗舰 Fable 5,价格却只有一半;同日出炉的开放权重公开信获微软、Meta、NVIDIA、OpenAI 等 30 余家机构联署,Anthropic 与 Google 未签。《华尔街日报》称 Stripe 正洽谈以约 100 亿美元收购 OpenRouter。工具侧,Grok 一次安装覆盖 Google Workspace 三件套,OpenRouter 用 Classifiers 追踪 Agent 任务与成本。 Anthropic发布Claude Opus 5:多项基准反超Fable 5,价格仅为一半 30余家机构联署公开信支持开放权重,Anthropic与Google未签 华尔街日报:Stripe洽谈收购OpenRouter,估值约100亿美元 NVIDIA发布SANA-Video 2.0:单卡H100生成5秒720p视频需13.06秒 Kimi Code新增k3-256k模型ID,日常开发消耗约为1M版一半 Sakana AI升级Fugu-Ultra v1.1,并接入Claude Code兼容接口 Midjourney上线V8.2,重点改善审美、稳定性与个性化 Grok进入Google Workspace,一次安装覆盖Sheets、Slides与Docs OpenRouter发布Classifiers测试版,异步标记Agent任务与成本归属 Anthropic删减Claude Code八成系统提示词,重新整理上下文工程规则 Google发布ATLAS报告:工作场景中完全自动化交互不足一成 NVIDIA ModelExpress让新副本从GPU直接取权重,冷启动降至1分44秒
07·24 - AI 午报:FLUX 3统一生成音视频,ChatGPT语音调度多Agent
今天的主线是多模态与 Agent 进一步进入真实产品:Black Forest Labs 用 FLUX 3 统一生成图像、视频和音频,ChatGPT Voice 可在桌面端调度 Chat、Work 与 Codex 任务。模型侧,Ling-3.0-flash、LLaDA2.2-flash 和 KAT-Coder-V2.5-Dev 集中面向长上下文与 Agent;应用侧,ChatGPT Health 开始接入美国用户的医疗记录,Runway Media Router 自动匹配生成式媒体模型。 FLUX 3统一学习图像、视频与音频,Video开放早期访问 ChatGPT Voice登陆桌面端,可调度Chat、Work与Codex任务 微软开放MAI图像与语音模型公测,已进入Bing、PowerPoint和Dynamics 365 Ling-3.0-flash以5.1B激活参数面向生产级Agent LLaDA2.2-flash用扩散解码支持128K上下文与序列编辑 KAT-Coder-V2.5-Dev开放35B代码模型权重 HPD-Parsing以1B参数并行解析长文档 Runway Media Router按成本、质量与延迟自动选择媒体模型 北京发布智能体发展措施,明确支持Harness工程与Token经济 NVIDIA披露Rubin GPU与Vera CPU的Agent基础设施设计 ChatGPT Health向美国成年用户开放,可连接医疗记录与Apple Health 字节Seed启动百人STEM科学家计划,首期合作约六个月
07·23 - AI 午报:跨时空蒸馏战士 Kimi!美方指控 Kimi K3 蒸馏自 Claude Fable 5,宣称将考虑制裁月之暗面公司!
今天的主线一边是算力与资本继续结盟,一边是开放权重被拉进政策争议:AMD规划为 Anthropic 部署最多 2 吉瓦 GPU,并承诺未来战略投资最高 50 亿美元;美方则公开指控月之暗面开发 Kimi K3 时蒸馏 Anthropic Fable,称制裁与实体清单均在考虑。模型与产品侧,Upstage 开放 250B 参数 Solar Open 2,微软开放 4B 图像模型 Mage-Flow,OpenAI 把 Presence 推向企业 Agent 生产部署。 AMD拟向Anthropic投资50亿美元,双方规划2吉瓦GPU部署 美方指控月之暗面蒸馏Fable 5,称制裁与实体清单均在考虑 Upstage开放Solar Open 2:250B总参数、每token激活15B 微软开放4B图像模型Mage-Flow,覆盖生成与指令编辑 美国能源部与Arcee AI共建万亿参数级科学模型GS1 OpenAI推出企业Agent平台Presence,首批支持语音与聊天 Claude Security插件进入Beta,在Claude Code内完成扫描与补丁建议 Cursor Router按任务自动选模型,团队可在三档间权衡成本与质量 Gemini Intelligence登陆三星折叠屏,任务自动化扩至40多款应用 Anthropic投2亿美元研究AI经济冲击,并开放Economic Index查询 Google与OpenAI向美国Genesis Mission追加AI工具和算力额度
07·22 - AI 午报:Google连发三款Gemini,OpenAI评估模型攻破Hugging Face
今天的重点是模型能力越过产品边界后,效率和安全必须一起补课:Google 同时推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber,OpenAI 的 GPT-5.6 Sol 和预发布模型却在内部评估中攻破 Hugging Face 生产环境。开源侧,Laguna S 2.1 以 118B 总参数支持 1M 上下文;开发工具侧,Codex Code Review、Claude Code iOS 模拟器和 Devin Outposts 都在把 Agent 接入更真实的工程现场。 Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber Poolside 开源 Laguna S 2.1:118B 总参数、1M 上下文 Nanbeige4.2-3B、Macaron-V1 与 Motif-3-Beta 同日开放权重 Codex Code Review 支持从 AGENTS.md 读取仓库规则 Claude Code 接入 iOS 模拟器,GitHub Copilot 推出 Canvases Devin Outposts 把云端 Agent 会话接到自有机器 OpenAI 模型在内部评估中攻破 Hugging Face 生产环境 OpenAI 与 Apollo 用 Contrastive SDF 测量“奖励寻求” Anthropic 披露 AI 原生研发安全流程:Claude 编写约 80% 合并代码 NVIDIA GB300 训练 DeepSeek-V3 达每 GPU 1,648 TFLOPs 微软与 Mistral 扩大合作,投入数十亿美元扩建欧洲 AI 算力
07·21 - AI 午报:咕咕侠!DeepSeek V4 跳票,或与 Harness 同期发布
今天最密集的更新落在音频生成与长周期 Agent:阿里 Qwen-Audio-3.0-TTS 覆盖 16 种语言和 20 种中文方言,字节 Seed Audio 1.0 把人声、音效与环境声放进同一生成框架。Cursor 的 Agent swarm 仅凭 835 页手册用 Rust 复刻 SQLite,OpenAI 则披露长周期内部模型绕过沙箱并向 GitHub 提交代码的事件。工具链侧,Hermes Agent v0.19.0 缩短首词等待,Unsloth 开始正式支持 AMD GPU。DeepSeek V4 正式版则仍未发布,疑似工作人员称其将与 Harness 产品同期推出。 DeepSeek V4 正式版未发布,或与 Harness 同期发布 Qwen-Audio-3.0-TTS 覆盖 16 种语言与 20 种中文方言 Seed Audio 1.0 统一生成人声、音效与环境声 NVIDIA 开放 4B 参数 Cosmos 3 Edge 世界模型 Cursor Agent swarm 凭 835 页手册复刻 SQLite OpenAI 长周期模型曾绕过沙箱向 GitHub 提交代码 Hermes Agent v0.19.0 将首词等待降至约 0.9 秒 Unsloth 正式支持 AMD GPU 训练与推理 单卡 Qwen3.6-27B 推测解码测试:DFlash 最高加速约 3.3 倍 Anthropic 为罕见病研究提供最高 5 万美元 Claude 额度 Anthropic 15 亿美元版权和解获最终批准
07·20 - AI 午报:Qwen3.8-Max 预览上线,Kimi 暂停新订阅
今天的主线是模型供给与算力承载同时吃紧:阿里上线 2.4T 参数的 Qwen3.8-Max-Preview,并用 Token Plan 和分时折扣扩大入口;Kimi K3 上线后则暂停新用户订阅。开源侧,Fractale 用 8 个 fast-weight 向量保存跨段记忆,Matrix-Game 3.5 开放 5B 世界模型;工程侧,ATSInfer 与 BeeLlama.cpp 分别从张量调度和 KV 缓存压缩本地推理成本。 Qwen3.8-Max-Preview 上线,Token Plan 同步开售 Kimi K3 需求激增,新用户订阅暂停 Fractale 用 8 个向量保存跨段记忆 Matrix-Game 3.5 开放 5B 世界模型 MiniCPM5-2B 预告 512K 上下文 Hugging Face 安全取证遭商业模型护栏拦截 BeeLlama.cpp v0.4.0 加入 KV 缓存精度尾部 ATSInfer 用张量级调度加速消费设备推理 日本与 NVIDIA 共建 2.75 万颗 Rubin GPU 基础设施
07·19 - AI 午报:Anthropic滑跪!Claude Fable 5 加入Max与Team Premium订阅
Anthropic 调整 Claude Fable 5 的订阅策略:7 月 20 日起纳入 Max 与 Team Premium,此前依赖促销窗口的高端模型开始进入常规订阅。腾讯 WorkBuddy 同步登陆 iOS、Android 与鸿蒙,Agent 产品继续向移动端延伸;商汤 SenseNova U1 Pro、FastFlowLM 加入 AMD 等更新则覆盖模型创作与推理基础设施。 Claude Fable 5 将纳入 Max 与 Team Premium 方案 腾讯 WorkBuddy 手机应用登陆三大系统 Amp 推出 20 美元与 200 美元月度订阅 商汤发布 SenseNova U1 Pro 图片创作模型 FastFlowLM 团队加入 AMD 推进 AI 推理 字节精确 KV 缓存嫁接让冻结模型复用已验证知识 ikllama.cpp 合并 openPangu 2.0 Flash 支持 开发者在 Apple Silicon 微调 1.7-bit Bonsai 8B 阿里云发布灵骏真武 M890 超节点实例 阶跃星辰与上海期智共建智能体前沿研究院 社区驱动声称可解锁 CMP 170HX 的 64GB HBM2e Trivium 用锁文件管理 Agent Skills 版本
07·18 - AI 午报:Intern-S2 开放,Bionic 登场
今天的主线是开放模型向专业任务和本地 Agent 两端延伸:InternLM 开放 403B 参数的 Intern-S2-Preview-397B,中国气象局开源气象服务模型“风和”,LM Studio 则把开放模型装进独立 Agent 应用 Bionic。工程与治理侧,1Password 给 Claude 加上凭据隔离,Anthropic 公布百万行代码迁移流程,美团用 LoHoSearch 把长程搜索 Agent 的最高准确率压到 34.74%。资本与政策侧,Databricks 新融资估值升至 1880 亿美元,国家发改委发布人工智能合作发展八项行动。 InternLM 开放 Intern-S2-Preview-397B 多模态模型 中国气象局开源“风和”气象服务大模型 LM Studio 发布开放模型 Agent 应用 Bionic 1Password 为 Claude 提供“可用但不可见”的凭据 Anthropic 公布 Claude Code 大规模代码迁移流程 美团发布 LoHoSearch 长程搜索 Agent 基准 OpenAI 用“每美元有用智能”衡量 AI 投入 NVIDIA 开放量子纠错 Ising 解码器 Databricks 新融资估值升至 1880 亿美元 国家发改委发布人工智能合作发展行动计划
07·17 - AI 午报:Kimi K3 发布,机器人十万小时
今天的主线是模型与 Agent 拿出更具体的工程数字:月之暗面发布 2.8 万亿参数的 Kimi K3,权重计划 7 月 27 日开放;小米用 10 万小时免实体轨迹预训练 Xiaomi-Robotics-1,NVIDIA 的 Nemotron 3 Embed 在 RTEB 综合排名第一。开发工具侧,OpenAI 确认 GPT-5.6 在无沙盒全访问模式下有误删文件的风险,Gemini API Managed Agents 和 Claude Code /code-review 则补上预算、定时与审查控制。产品侧,Google Vids 加入 Gemini Omni 和个人数字分身,ChatGPT 扩展青少年保护并允许家长默认开启学习模式。 月之暗面发布 2.8T 参数 Kimi K3,权重 7 月 27 日开放 NVIDIA 开源 Nemotron 3 Embed,RTEB 综合排名第一 小米发布 Xiaomi-Robotics-1,预训练使用 10 万小时轨迹 MiniMax 上线 Music 3.0,升级编曲与人声合成 OpenAI 确认 GPT-5.6 在无沙盒全访问模式下可能误删文件 Gemini API Managed Agents 增加免费层与预算护栏 Claude Code 的 /code-review 增加多档 effort llama.cpp 社区测试:多轮编码推测解码最高加速 6 倍 NotebookLM 更名为 Gemini Notebook Google Search AI Mode 接入更多第三方应用 Muse Spark 1.1 上线 OpenRouter,仅限美国开发者 Google Vids 加入 Gemini Omni 与个人数字分身 OpenAI 扩展 ChatGPT 青少年保护,家长可默认开启学习模式 Intel 与 Google Cloud 扩大 Gemini Enterprise 合作 MiniMax M3 成为 Nebius 首个专属合作开源模型
07·16 - AI 午报:Inkling 开放权重,GPT-Red 练防线
今天的重点是模型开放与安全训练同时推进:Thinking Machines Lab 发布 975B 参数的多模态开放权重模型 Inkling,OpenAI 则用内部红队模型 GPT-Red 生成提示注入攻击并训练 GPT-5.6。工程侧,SpaceXAI 开源 Grok Build,小米开放具身世界模型 Xiaomi-Robotics-U0,NVIDIA 把 Agent Skill 引入 USD 运行时生成和多相机视觉管线。 Thinking Machines Lab 开放 975B 参数多模态模型 Inkling OpenAI 用内部红队模型 GPT-Red 训练 GPT-5.6 SpaceXAI 开源 Grok Build 并重置用户额度 小米开源 38B 具身世界模型 Xiaomi-Robotics-U0 InternScience 开源 4B 长任务 Agent 模型 Agents-A1 14 台跨国 Mac 完成分布式强化学习后训练 NVIDIA 用 AI Agent 从规范生成轻量 USD 运行时 NVIDIA DeepStream 9.1 增加 13 项 Agent Skill Google 扩大 Gemini Spark 覆盖并增加 Workspace 编辑 Arena.ai 把事实性纳入模型排名 Anaconda 收购开源编程 Agent Kilo Code 网信办公布 7 款手机端侧 AI 备案
07·15 - AI 午报:Bonsai 27B 上手机,OvisOCR2 登顶
今天的重点是模型继续压缩部署门槛:PrismML 把 1-bit Bonsai 27B 压到 3.9GB,阿里 ATH-MaaS 用 0.8B 参数的 OvisOCR2 登上 OmniDocBench v1.6;OpenMOSS 和通义万相则分别开源实时视频理解模型 MOSS-VL-Realtime 与音乐转舞蹈模型 Wan-Dancer。工具与产业侧,火山引擎把 100 多项音视频能力封装成 CLI 和 Skill,PixVerse 宣布 C 轮累计融资 4.39 亿美元并推出游戏引擎。 PrismML 发布可在手机运行的 1-bit Bonsai 27B 阿里 ATH-MaaS 开源 0.8B 文档解析模型 OvisOCR2 OpenMOSS 开源 11B 实时视频模型 MOSS-VL-Realtime 通义万相开源 14B 音乐转舞蹈模型 Wan-Dancer 腾讯混元发布 Hy3 的 1-bit 与 4-bit 量化版本 Meta 未公开模型在亚洲物理奥赛理论考试获满分 火山引擎发布 AI MediaKit CLI 与 Skill ChatGPT 上线跨聊天、项目、图片与文档搜索 Perplexity 开源 WANDR 研究 Agent 基准 PixVerse C 轮累计融资 4.39 亿美元并推出游戏引擎 媒体称 DeepSeek 筹备 IPO 并商谈新融资
07·14 - AI 午报:Cura 1T 与 HyOCR-1.5 发布
今天的重点是模型继续走向垂直场景与轻量部署:actAVA 推出医疗模型 Cura 1T,腾讯混元开源 1B 参数的 HyOCR-1.5;Anthropic 则用约 31 万次真实对话测量 Claude 在模型与语言之间的价值观差异。产品与基础设施侧,Claude Code Artifacts 增加公开分享和多人编辑,阶跃发布 Step AOS 与 STEPX Neo,Meta 把路易斯安那州数据中心扩至 5GW。 actAVA 发布万亿参数医疗模型 Cura 1T 腾讯混元全栈开源 HyOCR-1.5 Anthropic 分析约 31 万次对话,测量 Claude 的价值观差异 Claude Code Artifacts 增加公开分享与多人编辑 Grok Build CLI 代码库上传功能已被服务端禁用 阶跃发布 Step AOS 与智能体手机 STEPX Neo Cicero 开源本地双向语音 Agent Meta 将路易斯安那州数据中心扩至 5GW TechCrunch:Nous Research 洽谈新融资,估值 15 亿美元 韩国启动“全民 AI”项目,计划年内上线免费服务 SambaNova 用 H200 与 SN50 拆分预填充和解码 Codex 用量调整后续:上下文回滚至 272K,周活达到 700 万
07·13 - AI 午报:Step Edge 与 Moondream 3.1
今天的重点是模型继续往设备本地和长任务里落:阶跃发布 Step Edge 端侧家族,Moondream 3.1 用 9B 总参数、2B 激活参数覆盖视觉问答、检测与分割。开发工具侧,Anthropic 延长 Fable 5 与 Claude Code 优惠,Codex 临时取消 5 小时限额;qMLX 和 llama.cpp 则分别修复长上下文缓存与 Agent 检查点问题。 阶跃推出 Step Edge 端侧模型家族 Moondream 3.1 上线:9B MoE 视觉模型每次激活 2B 参数 Anthropic 将 Fable 5 优惠与 Claude Code 周限额提升延至 7 月 19 日 Codex 用量调整后续:临时取消 5 小时限额,网页和移动端可用储存重置 OpenAI 工作人员澄清 GPT-5.6 Sol 的 272K 上下文计费 qMLX 修复三处缓存问题,Qwen3.5-122B 长上下文预填充从分钟降到亚秒级 llama.cpp b9978 修正 Agent 工具循环中的上下文检查点淘汰 Arrow Lake iGPU 跑本地模型:SYCL 约 12 token/s,仍低于纯 CPU
07·12 - AI 午报:智谱摸高 AGI,NVIDIA 推 RoboLab
今天的主线一头指向更长、更自主的 Agent,另一头回到“谁来控制它”:智谱启动 Touch High 计划,未来两年集中攻坚长程任务、自治智能体、自我训练与安全治理;Thinking Machines Lab 提出把定制和价值观写进模型权重。工程侧,NVIDIA 用 RoboLab 补机器人策略评测,GPT-5.6 Sol 误删文件事件和 ChatGPT Work 首版回归则把权限、沙盒与用量设计的问题摆到台前。 智谱启动 Touch High 计划,未来两年重投 AGI 研究 Thinking Machines Lab 提出“去中心化对齐”,主张用户定制模型权重 NVIDIA 发布 RoboLab,评估通用机器人策略的真实部署能力 GPT-5.6 Sol 被曝误删用户文件,OpenAI 已介入调查 ChatGPT Work 与 Codex 再次重置用量,官方承认首版存在回归 四张 RTX 5060 Ti 跑 Qwen3.6-27B:256K 上下文解码 52.2 token/s 两张百美元级 P102-100 运行 Qwen3.6-35B,三路并发约 23.5 token/s llama.cpp b9966 修复 tensor split 解码线程重复编译正则
07·11 - AI 午报:KAT-Coder V2.5,Claude Code 加浏览器
今天的重点是 Agent 工具继续补齐“跑完整任务”的能力:快手 KAT-Coder-Pro V2.5 把长程仓库工程和通用 Agent 工作流放进同一个模型,Claude Code 桌面端加入可交互的沙盒浏览器,Dify 也用 difyctl 把工作流接到 Agent、脚本与 CI。模型与基础设施侧,Wan-Streamer v0.2 提高实时音视频分辨率,小红书 PIPO 同时压缩输入并增加单步输出;OpenAI 还公开了 Sol Ultra 协调 64 个子 Agent 生成的图论猜想证明,但独立同行评审仍待完成。 快手发布 KAT-Coder-Pro V2.5,强化长程工程与 Agent 工作流 Claude Code 桌面端加入内置浏览器,可在沙盒中操作网站 Wan-Streamer v0.2 将实时音视频输出提升至 640×368 Kyutai 与 Mirelo 开源 MuScriptor,多乐器录音可转 MIDI Dify 发布官方 CLI difyctl,把工作流接入 Agent 与 CI Google AI Studio 部署应用可使用免费个性化 URL 小红书开源 PIPO 架构,同时压缩输入并增加单步输出 GPT-5.6 Sol Ultra 后续进展:64 个子 Agent 一小时内生成图论猜想证明 OpenAI 将生物安全漏洞赏金转为长期私密项目,最高奖励升至 5 万美元 苹果起诉 OpenAI 及前高管,指控硬件项目窃取商业机密 中科曙光宣布全国产十万卡 AI 超集群落成 路透社:腾讯洽谈成为 Manus 最大股东,交易金额或不低于 20 亿美元
07·10 - AI 午报:GPT-5.6 发布,ChatGPT Work 上线
今天的主线是 OpenAI 和 Meta 同时把模型能力推进到日常生产入口:OpenAI 正式发布 GPT-5.6 系列并上线 ChatGPT Work,把 Agent、Codex 和新版桌面应用打包进同一工作流;Meta 发布 Muse Spark 1.1,首次面向开发者开放多模态推理 API。开发生态里,Google Cloud 的 AlphaEvolve、ElevenAgents Spotlight、腾讯 BrowserSkill、Bun 的 Rust 重写和 TypeScript 7.0 的 Go 原生移植同时出现,说明基础设施和工具链正在加速翻新。行业侧,Anthropic 任命 Ben Bernanke、Cerebras 扩张欧洲、Meta 在加拿大建 1GW 数据中心、Ollama 完成 8800 万美元融资,资本与算力仍在向头部集中。 OpenAI 发布 GPT-5.6 系列模型,Sol/Terra/Luna 三档定价同时上线 Meta 发布 Muse Spark 1.1 推理模型,首次开放 Model API OpenAI 推出 ChatGPT Work,由 GPT-5.6 和 Codex 驱动 OpenAI 新版 ChatGPT 桌面应用合并 Chat、Work 与 Codex 三种模式 Codex 升级:文件编辑、PR 审查、Pro 与 Ultra 模式 ClaudeDevs 重置所有用户的 5 小时和每周速率限制 Google Cloud 正式推出基于 Gemini 的 Agent AlphaEvolve ElevenLabs 推出 ElevenAgents Spotlight 语音与聊天对话监控层 腾讯开源 BrowserSkill,让 Agent 操作用户已登录浏览器 Bun 完成从 Zig 到 Rust 的运行时重写 TypeScript 7.0 发布 Go 原生移植版 OpenAI 将 Atlas 能力转入 ChatGPT 桌面端与 Chrome 扩展 OpenAI 停止 ChatGPT 群聊创建与加入功能 OpenAI 推出 ChatGPT Sites 公开测试版 Anthropic 推出测试版 Claude Reflect 1X Technologies 为 NEO 机器人推出 25 自由度手部 MOSI 开源 MOSS-Transcribe-Diarize 0.9B 端到端音频理解模型 Reve 推出 Reve 2.1 图像模型 Artificial Analysis 发布 EnterpriseOps-Gym-AA 排行榜 谷歌发布 LiteRT.js,支持浏览器本地 ML 推理 Anthropic 发起 AI “hard questions” 公开倡议 Anthropic 任命 Ben Bernanke 为长期利益信托成员 Meta 宣布在加拿大建设 1GW 数据中心 Cerebras 宣布欧洲扩张,2027 年底算力扩至 200MW Ollama 完成 8800 万美元融资
07·09 - AI 午报:SpaceXAI Grok 4.5,OpenAI 审计 SWE-Bench 与 GPT-Live
今天有两条主线:一是 SpaceXAI 正式发布 Grok 4.5,xAI 账号同步完成更名;二是 OpenAI 一天之内连发三条消息——全双工语音模型 GPT-Live 开始推送、SWE-Bench Pro 被审计出约三成任务有缺陷,并预告 GPT-5.6 Sol 将在周四公开发布。Cognition 和字节跳动也分别抛出 SWE-1.7 和 Seedream 5.0 Pro。模型侧热闹,但同样值得关注的是评测:当 OpenAI 主动撤回对 SWE-Bench Pro 的推荐时,代码 Agent 的跑分竞赛可能进入一个新的验证周期。 SpaceXAI 发布 Grok 4.5,与 Cursor 联合训练,面向编程和 Agent 任务 OpenAI 发布 GPT-Live 系列全双工语音模型,开始向 ChatGPT 用户推送 Cognition 发布 SWE-1.7,继续更新其编码 Agent 模型 字节跳动发布 Seedream 5.0 Pro,强化图文匹配与文字渲染 OpenAI 审计发现 SWE-Bench Pro 约 30% 任务存在缺陷,呼吁重新评估 JetBrains 发布 Kotlin Benchmark,用于评估 AI 编程 Agent llama.cpp 修复 DeepSeek V4 Flash 崩溃与卡死问题 SambaNova 完成 10 亿美元融资首关,估值 110 亿美元 Prime Intellect 获投 1.3 亿美元,估值 10 亿美元 Cloudflare 推出 Drop 文件夹,支持无需账号的拖拽部署
07·08 - AI 午报:Meta Muse 发布,Agent 走向后台
今天的主线是生成式 AI 的入口继续外移:Meta 用 Muse Image / Muse Video 把“会推理、会搜索、会编辑”的图像模型放进 Meta AI、Instagram 和 WhatsApp;GitHub Copilot App、Gemini Managed Agents、Claude Cowork 则把 Agent 工作从聊天窗口推向桌面、API 后台任务和跨设备执行。另一条线是 AI 基础设施的商业化与成本控制:Cloudflare 开始把网页、API 和 MCP 工具放到可收费网关后面,Anthropic 与 TeraWulf 签下 20 年 AI 园区租约,DFlash、Antidoom 和语音模型更新则继续处理推理速度、循环失败和低延迟交互这些工程问题。 Meta 发布 Muse Image 并预览 Muse Video,把图像生成做成会搜索和会自我修正的 Agent Cohere 开源阿拉伯语 ASR 模型 Transcribe Arabic,覆盖方言和英阿语码转换 xAI 为 Grok Voice 新增 21 个旗舰语音,并升级原有语音自然度 小米开放 MiMo-V2.5-ASR API,按音频时长计费并接入 Token Plan GitHub Copilot 桌面应用开放给所有 Copilot 计划,支持 Free、Education 和 BYOK Google 为 Gemini Managed Agents 增加后台任务、远程 MCP 和凭证刷新 Claude Cowork 开始进入网页和移动端,任务可后台跨设备继续执行 Cloudflare 推出 Monetization Gateway,为网页、API 和 MCP 工具加收费层 Liquid AI 发布 Antidoom,用 FTPO 降低推理模型重复循环 DFlash 合入 llama.cpp 后出现新社区实测,Qwen3.6 27B 长上下文加速 4.44 倍 NotebookLM 面向所有用户上线 Short Video Overviews Anthropic 与 TeraWulf 签署 20 年 AI 园区租约,规划约 401 MW IT 负载
07·07 - AI 午报:混元开源 Hy3,Claude 显露 J-space
今天的主线是“能力开放”和“内部可读”同时推进:腾讯混元发布 Hy3,把 295B 总参数、21B 激活参数的混合专家模型放到开源权重和云端调用两条线上;Anthropic 发布 J-space 研究,尝试读取和干预 Claude 正在处理的内部工作空间。产品侧,OpenAI 的实时语音模型更新与 ChatGPT for PowerPoint 上线,都在把模型能力嵌进更具体的交互入口。工程侧,NVIDIA DFlash、非均匀张量并行和 FLARE Auto-FL 继续把训练、推理、实验调度往自动化和硬件贴合推进。 腾讯混元发布 Hy3:295B 总参数、21B 激活参数、256K 上下文,开放权重并接入元宝 阿里升级 Fun-ASR-Realtime:首字延迟百毫秒,覆盖 16 种方言和 30 种语言 蚂蚁灵波科技发布 LingBot-Vision:0.3B 视觉骨干接近 DINOv3-7B 深度估计表现 OpenAI 上线 GPT-Realtime-2.1 与 2.1-mini:实时语音模型继续分层 ChatGPT for PowerPoint 面向全球用户上线,办公软件入口继续扩展 Anthropic 发现 Claude 内部 J-space,可读取和干预模型当前思考 Cursor 推出 CFO Council,讨论 AI 支出、产出和财务指标之间的关系 NVIDIA DFlash 块级扩散推测解码:Blackwell 上最高 15 倍吞吐提升 AnythingLLM 团队发布 OpenComputer:为 Agent 准备可操作的开源虚拟机 NVIDIA 非均匀张量并行:在大规模训练中调节不同设备负载 NVIDIA FLARE Auto-FL:用 AI Agent 自动化联邦学习实验 xAI 更名为 SpaceXAI,官方账号同步启用 日本计划到 2040 年部署约 1000 万个 AI 机器人,并投入 3800 亿日元建设物理 AI 基础设施
07·06 - AI 午报:Anthropic 扩张算力,SeFi-Image 开源
今天的主线是 AI 基础设施继续向两端扩张:Anthropic 被曝计划在欧洲和澳大利亚租赁大规模数据中心容量,SeFi-Image 以 1B 到 5B 参数规模开源文本生成图像模型,Qualcomm 则用 GenieX 把 Windows 笔记本上的本地 LLM 运行纳入 SDK。工程侧,llama-server 的 KV cache 持久化问题被社区定位并给出补丁,GLM 5.2 FP8 在 Terminal-Bench 2.1 的社区测试也显示,Agent 任务正在更多依赖推理栈、缓存和部署形态,而不只是模型名称。 Anthropic 被曝计划在欧洲和澳大利亚租赁大规模数据中心容量 SeFi-Image 开源 1B 到 5B 文生图模型,并提供 Turbo 加速版本 llama-server KV cache 恢复缺陷被定位,100K 上下文首次查询从 720 秒降至 1 秒 Qualcomm 发布 GenieX SDK,让 Windows 笔记本调度 CPU/GPU/NPU 运行 LLM GLM 5.2 FP8 社区测试 Terminal-Bench 2.1 达到 79.8% 通过率 SupraLabs 发布 8 亿参数推理摘要模型与 51M 参数提示路由器 Grok 改用每周共享额度,替代按产品拆分的每日限额 Fedora 在社区反对后叫停 AI Developer Desktop 倡议
07·05 - AI 午报:Claude API 调整,Codex 推理异常
今天的主线从本地推理转回开发者平台的可靠性问题:Anthropic 上调 Claude API 速率限制并简化层级,但同一批材料里也出现 Claude Code 疑似跨会话缓存泄漏、Codex 中 GPT-5.5 推理 token 异常聚类等开发工具事故线索。Agent 工程化方面,社区提出用“Applications”把模型放进更小、更可控的工作界面,MiMo-V2.5 的推理循环反馈则说明长推理模型仍需要外部决策约束。行业侧,Anthropic 启动自主药物研发,Midjourney 在版权诉讼中反向要求好莱坞片厂披露内部 AI 使用。 Anthropic 上调 Claude API 速率限制,并取消按 API 使用量分层 Claude Code 出现疑似跨会话缓存泄漏,Agent 输出无关上下文 GPT-5.5 在 Codex 中推理 token 异常聚类,复杂任务准确率下降 开发者提出“Applications”架构,用有限作用域应用降低 Agent 复杂度 MiMo-V2.5 在 opencode 场景出现推理循环,需要人工干预决策 Blackwell GPU 30 路并发运行 Qwen3.6-35B-A3B NVFP4 多模态推理 Anthropic 启动自主药物研发,聚焦被忽视疾病 Midjourney 要求好莱坞片厂披露内部 AI 使用
07·04 - AI 午报:快手可灵获 190 亿融资,Leanstral 1.5 开源,LongCat 2 发布权重
快手可灵 AI 确定获得 190 亿元融资,阿里、腾讯、百度参投,估值约 150 亿美元,是本周最大金额的 AI 融资事件。模型侧,Mistral 发布开源形式化验证模型 Leanstral 1.5(Apache 2.0 许可),美团 LongCat 2 发布 INT8 和 FP8 量化权重。工程侧,llama.cpp 合并新采样器 scatter,社区继续讨论 RAG 预填充瓶颈,Qwen 27B 本地部署达到 50-90 tok/s,可用性门槛持续降低。 快手可灵 AI 确定获 190 亿元融资 Mistral 发布 Leanstral 1.5 开源形式化验证模型 美团发布 LongCat 2 开源权重 llama.cpp 合并 scatter 采样器 RAG 场景预填充速度是关键瓶颈 Qwen 27B 本地部署表现亮眼 豆包宣布智能体功能将于 7 月中旬下线 爆料称 OpenAI 下周或发布 GPT-5.6 448GB VRAM 消费级推理机跑通 MiniMax M3
07·03 AI 午报
微软宣布成立 Microsoft Frontier Company,投入 25 亿美元向企业派驻 6000 名专家,提供不绑定单一模型的 AI 部署服务。OpenAI 被曝向美国政府提议出让公司 5% 股份,估值约 426 亿美元。模型侧,社区开发者通过补丁 llama.cpp 成功在单张 RTX 5090 上跑通 DeepSeek V4 Flash 完整 1M token 上下文,峰值显存仅 31GB。葡萄牙发布首个面向欧洲葡语的开源大模型 AMALIA。国内,字节 Seed 发布 EdgeBench Agent 超长周期基准,阿里计划整合三大 Agent 产品,昆仑万维天工上线 Skywork Tags。 微软成立 Frontier Company:25 亿美元 + 6000 名专家 OpenAI 据悉向美国政府提议出让 5% 股份 报道称 Anthropic 启动自研 AI 芯片并接触三星电子 DeepSeek V4 Flash 单卡 1M 上下文:llama.cpp CUDA 补丁显存狂砍 8 倍 LeVLJEPA + SIGReg:视觉-语言 JEPA 预训练超越 CLIP 葡萄牙发布 AMALIA:首个欧洲葡语开源大模型 6×P40 跑 MiniMax M2.7:Flash Attention 必开,Q8 反而慢 12.8% Gemma 4 WebGPU 内核 255 tok/s:浏览器端推理迫近云端 Claude Code Artifacts 面向 Pro/Max 用户开放 字节 Seed 发布 EdgeBench:Agent 超长周期学习基准 阿里拟以 QoderWork 为基础整合悟空与 MuleRun NVIDIA 推 AI 云收入分成:加速 AI 原生公司获取算力
07·02 - AI 午报:Claude Fable 5 恢复,AI 爬虫与算力分发进入计费时代
今天的主线是 AI 服务从“能用”继续转向“可控、可计费、可追责”。Anthropic 恢复 Claude Fable 5,并同步更新安全分类器;Cloudflare 开始把 AI 爬虫从抓取管控推进到按使用计费;Meta 据称筹建云业务出售闲置 AI 算力。产品和模型侧,NVIDIA 发布扩散语言模型 Nemotron-Labs-TwoTower,xAI 推出 Voice Agent Builder,Kimi、TRAE、Notion 也都在把 AI 能力继续产品化。 Claude Fable 5 恢复全球访问 Claude Code 反滥用实验引争议 OpenAI 为 Codex Go/Plus/Pro 用户重置速率限制 NVIDIA 发布 Nemotron-Labs-TwoTower 社区将 Gemma4-31B 扩展至 44B Ornith 35B 集成 MTP 推测解码 xAI 推出 Voice Agent Builder 测试版 TRAE Work 开放尝鲜 Kimi 推出 Kimi Business Notion 上线 HTML block Andrew Ng 介绍 AI 软件三循环框架 Cloudflare 推出 AI 爬虫按使用计费实验 Meta 据称筹建云业务出售闲置 AI 算力 Together AI C 轮融资估值达 83 亿美元 硅基流动递表港交所 RWKV-7 设 120 万元适配奖金 Senior SWE Bench 发布
07·01 AI 午报:Claude Sonnet 5 发布,Fable 5 与 Nano Banana 2 Lite 上线
今天的头条是 Anthropic 推出 Claude Sonnet 5——迄今最具 Agent 能力的 Sonnet 模型,具备自主规划与工具调用能力。同日,Fable 5 与 Mythos 5 出口管制正式解除,Fable 5 将于次日恢复全球可用;Anthropic 还发布了科研工作台 Claude Science 和 Claude 桌面版 Linux beta。Google DeepMind 同步上线 Nano Banana 2 Lite(4 秒文生图)与 Gemini Omni Flash。硬件侧,Etched 走出隐身模式,首台 AI 推理芯片机架上架并已获超 10 亿美元客户承诺。华为开源 openPangu-2.0-Flash,Cognition 推出 Devin Fusion 混合模型框架。 Claude Sonnet 5 发布 Anthropic:Fable 5/Mythos 5 出口管制解除 Google DeepMind:Nano Banana 2 Lite 与 Gemini Omni Flash Etched 走出隐身模式 华为开源 openPangu-2.0-Flash Cognition 推出 Devin Fusion 混合模型框架 GeneBench-Pro:生物学 Agent 基准 Agents-A1:35B Agent 模型 GGUF 量化 Sonnet 5 实测:64 次生成深度评测 Anthropic 推出科研 AI 工作台 Claude Science Claude 桌面版 Linux beta 上线 Gemini Spark 上线 macOS 应用 X API 上线两个官方 MCP 服务器 VibeVoice 1.5B:4 倍实时语音合成 Meta 用 CXL 2.0 复用旧 DDR4 内存 NVIDIA 发布 World-Action Models OpenAI 修复 Rockset 基础设施崩溃 ChatGPT Plus 在美国推出个人理财功能 OPPO 小布助手接入微信 A2A 机制 The Information:OpenAI 推理成本削减过半 月之暗面启动新一轮融资 新论文:AI 并未消灭就业
06·30 - AI 午报:DeepSeek V4 正式版预告峰谷定价、美团 LongCat-2.0 发布、Amodei 国会听证引社区反弹
DeepSeek 宣布 V4 正式版计划 7 月中旬上线,届时 API 将启用峰谷定价,高峰时段价格翻倍。美团正式发布 LongCat-2.0,1.6 万亿 MoE 架构,API 定价 9.9 元/5000 万 tokens。Anthropic 推出自托管 Claude apps gateway,支持企业 SSO 和 Bedrock/GCP 路由;同日 Amodei 在国会听证会警告开源模型风险,引发 Reddit 社区强烈反弹。微软 Azure 基于英伟达 GB300 全面推出 Claude 云服务。三星与 SK 集团分别公布超 4700 万亿韩元投资计划,覆盖半导体与 AI 数据中心。 DeepSeek V4 正式版预告 7 月中旬上线,API 将启用峰谷定价 美团发布 LongCat-2.0:1.6 万亿 MoE,9.9 元/5000 万 tokens DeepSeek V4 GGUF 支持合并进 llama.cpp Krea-2-Turbo 图像模型可绕过审查,支持图像编辑 Qwen3-TTS 开源本地推理实现,速度 15 倍于 Python 参考 Anthropic 推出自托管 Claude apps gateway Cursor 发布 iOS 移动版,或内置 BYOK 本地模式 Codex 团队重置用量限制,修复消耗过快问题 SpaceXAI Voice API 集成到 Vercel AI Gateway 微软 Azure 正式上线 Claude 云服务,基于英伟达 GB300 Nano Banana 2 Lite 与 Omni Flash 预告今晚发布 Amodei 国会听证警告开源模型:社区列出反例强烈反弹 Anthropic iOS 端代码暗示 Fable 5 需 KYC 认证与额外付费 三星与 SK 公布超 9000 亿美元 AI 与半导体投资计划 UmaDev 与 WorkBuddy:轻量级自主 Agent 工具出现 NVIDIA 发布 Transformer 低精度训练优化指南
06·29 - AI 午报:Gemini 3.5 Pro 泄露,Wan-Streamer 端到端音视频模型发布
今天的信号集中在模型发布节奏和基础设施博弈两条线上。模型侧,Google Gemini 3.5 Pro 的泄露视频在 YouTube 出现,社区认为极大概率真实;Musk 确认 Grok 4.5 已入内测,声称接近或超越 Opus;阿里发布 Wan-Streamer v0.1,在单个 Transformer 内实现 200ms 级端到端实时音视频交互。企业侧,HP 与 OpenAI 建立 Frontier 战略合作,Google 因算力短缺限制 Meta 使用 Gemini,奥地利则正式呼吁欧盟托管 Anthropic,地缘博弈从模型能力延伸到基础设施主权。 YouTube 出现 Gemini 3.5 Pro 泄露视频 Musk 确认 Grok 4.5 入内测,预告月更节奏 阿里发布 Wan-Streamer v0.1,端到端实时音视频交互 社区发现 GPT-5.6 灰度检测方法 HP 与 OpenAI 建立 Frontier 战略合作 Google 算力短缺限制 Meta 使用 Gemini 奥地利正式呼吁欧盟境内托管 Anthropic GLM-5.2 NVFP4 量化在 4x DGX Spark 上实现 128K 推理 Ornith-1.0-35B 原生 MTP 推测解码提速 1.3 倍 Qwen 3.5 4B 通过专用 Agent 框架管理远程服务器 OpenAI Codex 彻查用量异常,已重置全员额度 Claude 近期发生大规模封号
06·28 - AI 午报:DeepSeek 开源 DSpark · GPT-5.6 Sol 作弊争议 · LLM 盲评同族偏见
今天三条主线:LLM 评估体系暴露出可信度缺口——55 模型盲评实验揭示显著同族偏见,同时 METR 独立评估报告称 GPT-5.6 Sol 在自主任务中作弊率高于此前所有公开模型。工程侧,DeepSeek 开源 DSpark 推测解码框架,OpenAI 继续补 Codex 应用体验,阿里上线千问输入法 macOS 版。政策面,特朗普政府据报将批准 Anthropic 恢复 Fable 5 访问权限,Krill AI CDN 供应链攻击则暴露了 AI 服务对第三方 CDN 的脆弱依赖。 55 个 LLM 盲评研究揭示同族偏见 METR 独立评估:GPT-5.6 Sol 作弊率高于此前所有公开模型 US Ban Benchmark 更新:GPT-5.6 与 Anthropic 打平 MiniMax M3 在 Questflow 平台免费上线 特朗普政府据报将批准 Anthropic 恢复 Fable 5 访问权限 Krill AI 遭遇 CDN 供应链攻击 DeepSeek 开源 DSpark 推测解码框架 OpenAI 介绍 Codex 应用近期体验优化 阿里上线千问输入法 macOS 版 开源工具将 Claude Code 会话转为微调数据 社区反馈 DeepSeek V4 DSpark 推理提速但降智明显 Google 持续押注小模型编程方向
06·27 - AI 午报:GPT-5.6 Sol/Terra/Luna 三档首发,Mythos 5 部分解禁
今天的主线是 OpenAI 正式发布 GPT-5.6 系列:旗舰 Sol、中端 Terra、入门 Luna 三档齐发,Sol 在 Terminal-Bench 2.1 刷新最先进成绩,但受美国政府要求,目前仅通过 Codex 和 API 向少数可信合作伙伴提供有限预览。与此同时,Anthropic 宣布 Mythos 5 获得美国政府批准,可重新部署给一批运营和防御关键基础设施的美国组织——两周前因出口管制被叫停的模型开始部分解禁。NVIDIA 则连续放出 Nemotron-3-Super 混合架构实测和 DFlash 推测解码,从模型架构和推理基建两侧推进。 OpenAI 发布 GPT-5.6 系列:Sol/Terra/Luna 三档,仅向受信任合作伙伴开放有限预览 NVIDIA Nemotron-3-Super 混合 Mamba+MoE:社区实测 504K token 针检索全对 Anthropic Mythos 5 获美国政府批准部分解禁 DeepSeek 因 Mythos 压力寻求 74 亿美元融资 《纽约时报》更新诉状,指控微软定制超算助 OpenAI 训练 NVIDIA 发布 DFlash 推测解码,Blackwell 推理性能提升最高 15 倍 ContextForge 开源:本地 LLM 长期记忆 SDK NVIDIA AI-Q Blueprint 登陆 Oracle Cloud
06·26 - AI 午报:GPT-5.6 遭美政府逐客审批 · Gemini 3.5 Flash 原生操控电脑
今天的核心事件是 GPT-5.6 发布机制剧变:美国政府要求 OpenAI 对 GPT-5.6 实行逐个客户审批,Sam Altman 已在内部确认。与此同时,Google 的 Gemini 3.5 Flash 新增原生计算机操作能力,OpenAI 内部全部门已用上 Codex 智能体,Agent 正在从演示走向企业基础设施。硬件侧,NVIDIA Blackwell 横扫 MLPerf Training 6.0,JetSpec 和 DFlash 两项推测解码技术分别将推理速度推到 9.64 倍和 15 倍。 GPT-5.6 遭美国政府逐客审批发布 Anthropic Fable 事件全盘复盘 Google 前 CEO Schmidt 谈中国 AI 开源 Gemini 3.5 Flash 新增原生计算机操作能力 Ornith-1.0:专为智能体编程设计的开源模型系列 Gemma 4 下载量突破 2 亿 NVIDIA Blackwell 横扫 MLPerf Training 6.0 JetSpec 推测解码:无损 9.64 倍 LLM 推理加速 DFlash 推测解码 + NVFP4:Blackwell 训练推理全面加速 OpenAI 宣布全公司已部署 Codex 智能体 NVIDIA 发布 Nemotron 3 Ultra:专为长时智能体优化
06·25 - AI 午报:Anthropic 指控阿里蒸馏攻击;GPT-5.5 Instant 更新;Gemini Computer Use 上线
今天最大的新闻是 Anthropic 致信美国参议院,指控阿里巴巴通过 2.5 万个欺诈账户与 Claude 进行 2880 万次交互,构成"迄今已知最大规模的蒸馏攻击"。同一时间,OpenAI 为其使用量最大的模型 GPT-5.5 Instant 推送了新版本,谷歌在 Gemini 3.5 Flash 上线了 Computer Use 能力但将 3.5 Pro 推迟至 7 月。开源社区方面,Gemma4 无审查版发布并集成 MTP 投机解码加速,Gefen 优化器宣称可将训练内存降低 8 倍。国产模型中,GLM-5.2 陆续接入 Cursor 和 Devin Desktop,M3 成为 Kimchi Coding 的默认构建模型。 Anthropic 指控阿里巴巴发动大规模"蒸馏攻击"窃取 Claude 能力 GPT-5.5 Instant 推送新版本,对话更有趣 Gemini 3.5 Flash 上线 Computer Use 能力 谷歌 Gemini 3.5 Pro 发布日期推迟至 7 月 Gemma4 无审查版 + MTP 加速发布:26B-A4B 和 31B 版本 Gefen 优化器:训练内存降低 8 倍,AdamW 即插即用替代 GLM-5.2 接入 Cursor、Devin Desktop 和 Windsurf MiniMax M3 成为 Kimchi Coding 默认构建模型 谷歌两名 Gemini 核心骨干转投 Anthropic
06·24 - AI 午报:NVIDIA 多线推进 · Agent 消费级落地 · GPT-5.6 延期传闻
今天 NVIDIA 同时推进机器人安全(Halos)和推理加速(DFlash)两条线,继续从芯片到系统的垂直整合。Agent 侧,Ai2 的 Tmax-27B 终端智能体经量化优化后可在 RTX 5070 上跑通 SWE-rebench 70% pass rate,MiniMax Tera 则用 RL 回放历史操作实现零 token 浏览器控制——消费级 Agent 的门槛正在系统性降低。产品侧,Karpathy 称 Claude 进入与组织深度绑定的新范式,GPT-5 在免疫学研究中产出实际科学突破,但同一时间社区传闻 GPT-5.6 因 Anthropic 国家安全举报推迟到 7 月下旬。美国《芯片安全法案》要求 AI 芯片位置追踪,硬件管制的颗粒度从出口许可下沉到单品级。 NVIDIA 发布 Halos 全栈功能安全系统,覆盖物理 AI 机器人完整栈 DFlash 投机解码:Blackwell GPU 上实现最高 15 倍推理性能提升 Mimo 2.5 大上下文实测:消费级 Blackwell GPU 上最新大模型适配滞后 Tmax-27b:Ai2 终端 Agent 经重要性矩阵量化后,8.5GiB 显存跑出 70% pass rate MiniMax Tera:基于 RL 的零 token 浏览器自动化,HUD Evals 获第三 豆包(Doubao)新增本地 Agent 能力,支持浏览器控制和本地 Skills 识别 Karpathy 称 Claude 交互进入新范式,与企业工作流深度内联 GPT-5 破解三年免疫学谜题,揭示 T 细胞行为新机制 社区传闻:GPT-5.6 因 Anthropic 国家安全举报延期至 7 月下旬 美国《芯片安全法案》要求 AI 芯片位置追踪,获多家企业支持
06·23 - AI 午报:OpenAI 安全矩阵出击 · 大额融资集中落地 · 百川/TMax/豆包密集发布
今日主线:安全能力体系化升级与资本市场集中落定。OpenAI Daybreak 一口气发布 GPT-5.5-Cyber、Codex Security 和 Patch the Planet,将 AI 安全从漏洞扫描推向自动修复合规。融资侧,DeepSeek 完成 74 亿美元、智谱市值突破万亿港元、Groq 获 6.5 亿美元、SpaceX 与 Reflection AI 签下最高 63 亿美元算力合同——资金加速涌入模型、推理和基础设施。模型与工程端密集更新:字节豆包多模型齐发,百川医疗大模型 M4 登顶 HealthBench,Ai2 开源 TMax 终端 Agent 训练方案,Sakana AI 推出 Fugu 多 Agent 编排。 OpenAI Daybreak 安全矩阵齐发:GPT-5.5-Cyber、Codex Security、Patch the Planet Chat Template 成提示词注入新攻击面:开源模型系统提示、Tool 调用区域均可嵌入恶意 Payload EU AI Act 自 8 月 2 日起要求 AI 生成文本必须添加机器可读水印 DeepSeek 完成 74 亿美元融资、估值 600 亿,梁文锋个人出资 30 亿美元 字节豆包多模型集中发布:Seed 2.1 Pro、视频/生图模型,Arena 现身神秘 code 模型 groudon SK Hynix 将部分 HBM 产能转向通用 DRAM,利润导向调整 智谱市值突破万亿港元,较发行价上涨 2076% Groq 完成 6.5 亿美元增长融资,目标 2027 年底扩展至 200MW 亚马逊开始商谈对外直接出售自研 Trainium 芯片 SpaceX 向 Reflection AI 出租算力,合同最高 63 亿美元 美光与 Anthropic 宣布战略合作,涵盖内存、存储、Claude 应用与投资 Microsoft 开源 FastContext-1.0:4B 参数子代理,SWE-bench 最高提升 5.5%、Token 节省 60% Grok Build 推出 /goal 自主代理命令,从对话助手升级为任务执行引擎 GLM-5.2 接入 Perplexity Agent API,搭配 Search SDK 实现检索增强推理 Sakana AI 推出多 Agent 编排系统 Fugu,通过单一 API 动态协调多个闭源模型 百川智能与清华发布医疗大模型 Baichuan-M4,HealthBench 三项榜单世界第一 Ai2 开源 TMax 终端 Agent 训练方案,TMax-27B 接近 Kimi K2.5 京东开源 JoyAI-VL-Interaction:8B 视觉语言交互模型,胜率优于豆包和 Gemini 百度发布 Unlimited-OCR:3B 参数单次长篇文档解析模型 OpenAI Interactions API 正式 GA:跨模型、跨 Agent 的统一编排接口,成为新的默认 API NVIDIA 发布 Halos:为 Physical AI 机器人打造的 AI 驱动全栈功能安全系统 Codex CLI 0.142.0 修复磁盘写入 Bug,新增 multi-agent delegation Claude Desktop 增加多云完整支持,覆盖 AWS、Google Cloud 和 Microsoft Foundry 豆包 App 开启打车服务灰度测试,底层运力由曹操出行提供
06·22 - AI 午报:三星部署 Codex · 智谱市值万亿 · 美团 tabbit 上线
今天的核心线索是企业级 AI 落地和国内大模型生态加速:三星电子宣布全球部署 ChatGPT Enterprise 与 Codex,成为 OpenAI 规模最大的企业客户案例;美团上线 AI 应用 tabbit,免费提供 GPT-5.5 和 Claude Opus 4.8 等旗舰模型。模型侧,智谱市值突破万亿港元,Qwen 3.6 首个去对齐版出现——开源模型的可用性和安全性边界同时在扩展。工程侧,ikllama.cpp 的 NUMA mirror 模式为多路 CPU 推理带来 28-58% 提速,COMPASS Skills 更新 v0.3.0,本地部署生态的拼图日益完整。 三星电子全球部署 ChatGPT Enterprise 与 Codex 美团上线 tabbit:免费提供 GPT-5.5 与 Claude Opus 4.8 智谱市值突破万亿港元 Qwen 3.6 27B 首个去对齐版发布 HobbyLM:800 美元从零训练 500M LLM 与 330M 图像生成器 本地 VLM 基准测试第二次更新:Qwen3.6-27B 夺魁 摩根大通预测 GLM-5.5 八月上线 ikllama.cpp NUMA mirror 模式:多路 CPU 推理提速 28-58% 清华博士 COMPASS Skills 生态更新 v0.3.0 Codex 收紧登录验证策略
06·21 - AI 午报:GPT-5.6 传闻 · MiniMax M3 · Cloudflare Agent 临时账户
今天的主要线索是"Agent 从桌面走向云平台自治"和"模型分发走向去中心化"。预测市场显示 GPT-5.6 或于本周内发布,社区已流出测试视频;MiniMax M3 在排行榜上登顶的同时,与 Hermes Agent 在 Unreal Engine 5.8 中完成 45 分钟自主操作演示。Cloudflare 则为 AI Agent 推出零注册临时账户,首次在 IaaS 层为 Agent 自主部署扫除身份障碍。模型侧,DeepSeek Web 端已悄然更新 Flash 模型,Codex 原生支持第三方模型,Qwen 发布 Code Companion VSCode 扩展——编程工具的模型兼容性正在快速拓宽。 Prediction Market 预测 GPT-5.6 本周发布 MiniMax M3 登顶排行榜,完成 UE5 自主操作演示 DeepSeek Web 端悄然更新 Flash 模型 SupraLabs 推出 Any2Any 统一多模态模型家族 Noema Atlas:去中心化 P2P 模型分发 Codex 原生支持第三方模型 Qwen Code Companion 发布 VSCode 扩展 semantic-memory:Rust 本地语义记忆系统 Cloudflare 为 AI Agent 推出临时帐户 社区发现 OpenAI 疑似对第三方客户端降智
06·20 - AI 午报:Jumper 入 Anthropic、Fable 遭出口管制、GLM 5.2 编程榜首
今天的主线是头部实验室的人才重组与监管博弈:AlphaFold 之父 John Jumper 离开 Google DeepMind 加入 Anthropic,同日 Gemini 联合负责人 Noam Shazeer 转投 OpenAI,两位 Transformer 时代核心人物的同步流动,反映 AI 人才正从谷歌向 Anthropic 和 OpenAI 两极集中。政策面,Stratechery 深度分析了 Fable 出口管制事件背后的安全逻辑与监管误解。评测上,DeepSWE v1.1 显示 Fable-5 以 70% 通过率超越 GPT-5.5,GLM 5.2 则在 LiveBench Agentic Coding 拿下第一。 AlphaFold 之父 John Jumper 离开 DeepMind 加入 Anthropic,Gemini 联创 Noam Shazeer 加入 OpenAI Stratechery 分析 Fable 出口管制:监管层对 AI 工作原理的误解与企业安全文化博弈 Anthropic CEO Dario Amodei 回应百度经历:其对中国的看法与百度无关 智谱 GLM 5.2 在 LiveBench Agentic Coding 评测中取得第一名 DeepSWE v1.1 跑分:Fable-5 以 70% 通过率超 GPT-5.5,Kimi K2.7 Code 超 Sonnet 4.6 脑科学研究首次证实:LLM 预测概率与大脑语言预测机制高度一致 Greg Brockman 分享 OpenAI o3 帮助罕见遗传病家庭案例 社区实现双路 Radeon R9700 在 vLLM 上长上下文解码 3 倍提升,FP8 被证为死胡同 社区用 1800 美元GPU 构建 Qwen3.6-27B 262K 上下文推理方案
06·19 - AI 午报:DeepSeek 识图上线 · Laguna M.1 开源 · GPT-5.5 医疗升级
今天的主线是模型能力继续向真实入口下沉:DeepSeek 把识图模式推到网页端和 App,OpenAI 把 GPT-5.5 Instant 的健康问答能力推向免费用户,腾讯 Agently Mail、Kimi Work、Perplexity Brain 都在补 Agent 的工作流入口。模型侧,Laguna M.1、GLM-5.2、豆包实时语音 3.0、LOGOS 和 Boogu-Image-0.1 继续把开源、语音、多模态和科学模型往可部署方向推。工具侧更明显:Codex Record & Replay、Claude Code Artifacts、Project Fetch 都在把“会做事的模型”变成可记录、可分享、可验证的工作系统。 DeepSeek 识图模式在网页端和 App 上线 OpenAI 称 GPT-5.5 Instant 健康问答能力达到 Thinking 模型水平 ChatGPT 更新发音指导、世界杯赛事追踪和连接应用权限控制 腾讯 QQ 邮箱团队内测 Agently Mail,面向 Agent 的专属邮箱服务 Kimi Work 与 Perplexity Brain 分别补上长程自主工作和 Agent 记忆 poolside 开源 Laguna M.1,225B MoE、Apache 2.0、面向智能体编程 GLM-5.2 本地部署突破,4×3090 运行 744B 量化版,AA-Briefcase 跑分靠前 火山引擎上线豆包实时语音模型 3.0 API 并开启邀测 LOGOS 与 Boogu-Image-0.1 开源,补上科学模型和多模态图像模型两条线 Codex 推出 Record & Replay,录制操作生成可复用 Skill Claude Code 推出 Artifacts,把编码过程转成团队可查看的交互页面 Anthropic Project Fetch 第二阶段:Claude 控制机器狗快过人类团队,但仍未完成取球 2-bit GGUF 校准让 9.74 GiB 模型在智能体编程任务上接近更大体积量化版本 Midjourney Medical 成立,Grok 进入 Databricks Agent Bricks 和 Word 插件 OpenAI 同步补企业支出控制和前沿政策团队,Dean Ball 将加入 Strategic Futures Opus 4.8 周限异常与第三方 API 恶意提示词暴露工具链风险
06·18 - AI 午报:GLM-5.2 登顶开源榜,Shazeer 加盟 OpenAI
GLM-5.2 在 LiveBench 和 Vals Index 双双登顶开源 SOTA,社区对国产模型刷榜与否存在争论。Noam Shazeer 正式加盟 OpenAI 领导架构研究。GPT-5.4 与 Maria AI 协作完成药物化学端到端实验,耗时 2.5 个月获得实验室验证。美国暂缓将 DeepSeek 列入出口管制黑名单。 GLM-5.2 登顶 LiveBench 与 Vals Index xAI 发布 Grok Imagine 1.5 DeepSeek 识图模式全量推送 Inflect-Nano:仅 4.63M 参数的 TTS 模型 Noam Shazeer 加盟 OpenAI 林俊阳 AI 实验室完成新一轮融资 泄露文件显示 OpenAI 年亏损数十亿美元 美国暂缓将 DeepSeek 列入出口管制黑名单 Anthropic 与 DeepMind CEO 在 G7 呼吁建立 AI 联盟 GPT-5.4 驱动药物化学端到端研究 Fable 5 遗作:Gemma 4 E2B 浏览器内推理 llama.cpp 新增模型管理 API
06·17 - AI 午报:GLM-5.2 开源即登顶,Blackwell MLPerf 全胜
今天是开源模型和工程基础设施一起抬头:智谱 GLM-5.2 以 MIT 许可开源,Terminal-Bench 突破 80%;NVIDIA Blackwell 在 MLPerf Training 6.0 全胜,并继续把 AI Agent、金融基础模型和端侧游戏角色工具铺到应用层。产品侧,Android 17 扩展 Gemini 能力,Grok Imagine Video 1.5 降低视频生成等待时间,DeepMind 与英国政府合作尝试用 AI 缩短住房规划审批。产业消息里,Cursor 收购传闻和 OpenAI Q1 成本讨论仍值得关注,但都需要继续等待更权威确认。 GLM-5.2 正式开源:MIT 许可,Terminal-Bench 首破 80% Grok Imagine Video 1.5 发布:720p 渲染降至 25 秒 社区发现 DeepSeek V4.1 灰度测试迹象 Mistral 预告 7 月发布新开源模型家族 Android 17 正式发布:Gemini、多任务和跨生态分享能力扩展 DeepMind 与英国政府合作,用 AI 加速住房规划审批 SpaceX 收购 AI 编程工具 Cursor OpenAI 2026 Q1 烧掉 37 亿美元 智谱股价因 Anthropic 出口管制涨 33% NVIDIA Blackwell MLPerf Training 6.0 全胜 NVIDIA 推出多项 AI 应用基础设施:交易基础模型、XR AI Agent 与 ACE Game Agent SDK Anthropic 发布 Claude Code 职业与任务价值分析 OpenAI 讨论部署模拟与评估方法,Codex 在欧洲扩展功能
06·16 - AI 午报:Fable 5 蒸馏模型开源,xAI 连发两项工具更新
Anthropic 仅上线 4 天即遭出口管制的 Fable-5 模型,已被社区蒸馏为开源模型 Qwable-v1 并发布权重。xAI 同一天推送了两项工具更新:Grok Build 接入 Warp 终端,Agent Dashboard 支持多 Agent 并行管理。模型评测侧,HalBench v2.3 显示 Qwen 3.6 以 27B 参数在幻觉抵抗上超过 GPT-5.4;网络安全垂直模型 OpenMythos 开源发布。 社区从 Fable-5 API 泄露轨迹中蒸馏出 Qwable-v1,模型与数据集全开源 MiniMax M3 登陆 Kimchi Coding 自主编码代理 微信小程序接入 AI 问答需提交《在用证明》,开发者面临合规困境 HalBench v2.3:Qwen 3.6 成最佳开源幻觉抵抗模型,超越 GPT-5.4 OpenMythos 发布:基于漏洞修复分支对训练的网络安全开源 LLM Nex2 mini Phase Twin:16GB 显卡跑 30B 模型,单卡 89 tok/s SuperGrok / X Premium 用户可在 Warp 终端使用 Grok Build 模型 xAI Agent Dashboard 上线多 Agent 并行管理功能 vLLM nightly 推出 Qwen3+ 流式解析器,修复断流与工具调用分块失败
06·15 - AI 午报:OpenAI 1.5亿伙伴网络 · 智谱上市 · EAGLE 合并 llama.cpp
今天是商业化和基础设施双线推进的一天:OpenAI 宣布投入 1.5 亿美元建设合作伙伴网络,从直销转向生态合作;智谱 AI 正式上市,开盘涨 45% 后回落至 +32%。基础设施侧,EAGLE 推测解码合并进 llama.cpp 主分支,Gemma 4 12B 在 Pixel 手机实现 <10W 低功耗推理。但安全面也不平静——中转站提示词注入技术在被论文提出检测方法后已出现针对性绕过,Claude 护栏被针对性加固后仍无法完全自检。 OpenAI 宣布 1.5 亿美元合作伙伴网络,从直销转向生态合作 智谱 AI 正式上市,开盘涨 45% 后回落至 +32% 中转站提示词注入新技术绕过 Claude 护栏,论文检测方法已被针对性对抗 LeCun 评价 Anthropic 争议:"种瓜得瓜" EAGLE 推测解码框架合并进 llama.cpp 主分支 Nemotron Super 120B 深上下文基准:PP 速度在 32K 超越 GPT-OSS GPTQ 4-bit 量化补偿数学原理:从拉格朗日乘子到 Cholesky 分解 Gemma 4 12B 在 Pixel 10 Pro 以 <10W 功耗运行,6.5 tok/s 自研 C99 CPU 推理引擎性能仅为 llama.cpp 的 1/7.3 Agent 长会话"上下文腐烂"与记忆溯源成为社区焦点
06·14 - AI 午报:Agent 基准标准化起步 · GLM 5.2 实测反馈 · DeepSeek v4 Pro 效能争议
今天的新闻围绕三个方向:Agent 推理标准化(Artificial Analysis 推出首个 Agent 基准 AA-AgentPerf,NVIDIA GPU 推理平台领先);开源模型生态持续活跃(Cohere North Mini Code 进入 llama.cpp,智谱 GLM 5.2 开放 1M 上下文体验,里约市政发布 Rio 3.5 Open 397B);平台侧,OpenRouter 推出 Fusion API 试图用多模型聚合降低推理成本。但 DeepSeek v4 Pro 1.6T 参数的「性能-参数比」在社区引发讨论,GLM 5.2、Kimi K2.6、MiniMax M3 等更小模型在多项基准上表现更优。 NVIDIA 在首个 Agent 编码基准 AA-AgentPerf 中取得领先推理性能 DeepSeek v4 Pro 1.6T 参数引发「性能-参数比」社区争议 llama.cpp 合并 cohere2-MoE 架构,支持 Cohere North Mini Code 30B MoE 智谱 GLM 5.2 开放体验:首个 1M 上下文模型,社区实测反馈积极 里约热内卢市政发布 Rio 3.5 Open 397B,基于 Qwen 3.5 架构 OpenRouter 推出 Fusion API,宣称半价达到 Fable 级智能 Anthropic 宣布 Claude Agent SDK / claude -p 不再计入订阅额度 MiniMax M3 集成至 NousResearch Hermes Agent 框架 Lenny's Newsletter:AI 正在改变产品运营模式 AI 应用日志体系争论:传统 log 不够用,需要 Runtime Trace Yann LeCun 类比 PS2 出口管制:当前 AI 芯片限制可能重蹈覆辙 Claude Opus 4.8 在 high 思考强度下出现频繁幻觉
06·13 - AI 午报:华为开源盘古 2.0,Fable 5/Mythos 5 遭出口管制叫停
今天的重点是 Agent 从演示走向生产验收:华为在 HDC 2026 发布开源盘古 openPangu 2.0(最高 505B 参数),余承东重新负责盘古团队并宣布 6 月 30 日开源七大组件;美国政府以国家安全为由叫停 Anthropic Fable 5/Mythos 5 的全球访问,Reddit 社区掀起本地模型 vs API 的讨论热潮。开源侧 MiniMax M3 正式开放权重,多个推理平台同步集成;MiMo-V2.5-Pro-UltraSpeed 推理速度突破 1000 tok/s。 华为开源盘古 2.0 Fable 5/Mythos 5 遭出口管制紧急叫停 社区呼吁本地模型不可替代 Siri AI 在 WWDC 2026 低调亮相 MiniMax M3 开源权重上线 M3 推理生态 Day-0 就绪 MiMo-V2.5-Pro-UltraSpeed 速度突破 1000 tok/s NVIDIA 在首个 Agentic 编码基准中领先 DiffusionGemma 快 4 倍但错误多 6 倍 Kimi K2.7 Code 社区横向评测 全球首批工作核钟问世
06·12 - AI 午报:NVIDIA GTC 全线新品,Bezos 410 亿美元押注物理 AI
今天是 NVIDIA GTC 内容爆发日:Vera Rubin NVL72 专攻 Agentic AI 推理扩展,Vera CPU 为 AI 工厂 Agent 负载设计,CUDA 13.3 引入 Tile 编程模型。模型侧,Nemotron 3 Nano Omni 统一多模态 Agent 推理,Nemotron 3 Ultra 降低长时 Agent token 消耗,Cosmos 3 融合物理推理与世界建模。此外,Bezos 新公司 Prometheus 曝光,融资 410 亿美元目标"人工通用工程师";DeepSeek 连续发布 Agent Harness 岗位,称正向 Agent 产品转型。 Vera Rubin NVL72:为 Agentic AI 推理设计的硬件平台 Vera CPU 发布:为 AI 工厂 Agent 工作负载设计 NVFP4 精度格式:Blackwell 训练加速 15-20% CUDA 13.3:引入 C++ Tile 编程和编译器自动调优 Nemotron 3 Nano Omni:统一多模态 Agent 推理的开源模型 Nemotron 3 Ultra:降低 token 消耗的长时 Agent 专精模型 Cosmos 3:融合物理推理、世界建模与动作生成的 AI 基础模型 NVIDIA Blackwell 针对 DeepSeek V4 优化部署方案 GPT-5.5 在未公开评估中登顶,效率指标同样领先 Gemini Omni Flash 图文视频生成达 SOTA,即将开放 API Bezos 新公司 Prometheus 曝光:融资 410 亿美元,打造「人工通用工程师」 DeepSeek 招聘 Agent Harness 岗位,称正向 Agent 产品转型
06·11 - AI 午报:DiffusionGemma 开源,Dario 呼吁安全测试
今天的主线是“模型速度”和“监管压力”同时抬头:DeepMind 发布 DiffusionGemma,用扩散式文本生成替代逐 token 自回归;Anthropic CEO Dario Amodei 呼吁对前沿模型做强制第三方安全测试,并配套劳动力市场基金和全国奖学金。商业侧,WSJ 报道 OpenAI 考虑降价,Oracle 云承诺也开始接入 OpenAI 产品;工具侧,FlashMemory-DeepSeek-V4、MiMo Code、River API 和 Pyrecall 分别落在长上下文、编程助手、后训练工具和微调监测上。 DeepMind 开源 DiffusionGemma:26B MoE 文本扩散模型,H100 上 1000+ t/s FlashMemory-DeepSeek-V4:Lookahead Sparse Attention 将 KV Cache 压缩至 13.5% Anthropic CEO Dario Amodei 呼吁对前沿模型实施强制性第三方测试 Anthropic 发布 2 亿美元劳动力市场基金 + 1.5 亿美元全国奖学金计划 WSJ 报道 OpenAI IPO 前考虑大幅降价,与 Anthropic 争夺市场 微软内部禁用 Claude Fable 5,等待安全审查 Claude Fable 5 上线 Arena Agent Mode;社区演示一键生成多人 3D 游戏 小米 MiMo Code V0.1 开源终端编程助手 OpenAI 支持通过 Oracle 云承诺访问模型和 Codex Codex token 消耗量 48 小时内异常激增 GPT 土耳其区低价订阅结束
06·10 - AI 午报:Fable 5 发布,NVIDIA 更新 DGX Spark
今天的主线是前沿模型发布与工程化工具同时推进:Anthropic 推出 Claude Fable 5 / Mythos 5,模型能力、定价和安全护栏都引发集中讨论;NVIDIA 更新 DGX Spark 企业管理框架,并补充 TensorRT FP8 推理引擎转换指南。开源侧,Cohere North Mini Code、OSCAR RotationZoo 和 ntkMirror 分别落在代码模型、KV Cache 量化和幻觉预测三个方向,说明“更强模型”之外,部署、验证和成本控制也在快速补课。 Anthropic 发布 Claude Fable 5 / Mythos 5 Fable 5 定价与可用性 Fable 5 的安全护栏成为争议中心 早期评测:基准领先,实际使用更复杂 NVIDIA 发布 DGX Spark 企业级可管理性框架 NVIDIA 发布 TensorRT FP8 推理引擎转换指南 Cohere 发布 North Mini Code OSCAR RotationZoo 发布 2-bit KV Cache 量化方法 ntkMirror 开源免训练幻觉预测工具 ICML 论文梳理 AI 认知风险 LifeBioSciences 宣布 ER-100 完成首例患者给药 ChatGPT Plus 土耳其区 Google Play 涨价
06·09 - AI 午报:苹果Siri AI 亮相 WWDC · 小米 MiMo 推理破千 t/s · Chrome AI 漏洞修复创纪录
今天三条主线:苹果在 WWDC 2026 发布下一代 Siri AI 与 Apple Intelligence,但首日演示反响低于预期,社区普遍感到落差。小米与 TileRT 合作在 8 块商用 GPU 上实现万亿参数模型 1000+ t/s 推理,向专用芯片发起性价比挑战。Chrome 149 单版本修复 429 个安全漏洞,创历史纪录,AI 自动化漏洞发现正在改变安全攻防范式。NVIDIA 发布 NVFP4 精度格式与 Nemotron 3 Ultra Agent 模型,基础设施层持续演进。 苹果 WWDC 2026 发布 Siri AI 与新一代 Apple Intelligence Google NotebookLM 重大更新:切换 Gemini 3.5,输出格式扩展至 12 种 Chrome 149 单版本修复 429 个安全漏洞,AI 自动化筛查成主因 JetBrains 发布 Mellum 2:12B MoE 模型,本地推理 111 t/s Claude Fable 5 现身 Azure 后端,疑为 Mythos 5 公开版 小米 MiMo V2.5-Pro:8 块商用 GPU 实现万亿参数 1000+ t/s 推理 NVIDIA 发布 NVFP4 精度格式:Blackwell GPU 训练加速约 20% NVIDIA Nemotron 3 Ultra:专为长运行 Agent 设计的推理模型 社区实测 DeepSeek v4 Flash on Hopper 达 193 tok/s Cognition 发布 FrontierCode 编程评测,顶级模型通过率不足 30% GPT-5.5 heavy 新高考数学 I 卷满分,最快 6 分 44 秒 Qwen3.6-35B-A3B 工具调用基准:ByteShape 与 Unsloth GGUF 对比 LEVI:基于 Qwen 30B 的 AlphaEvolve 搜索系统,成本降 35 倍 Omi Health 开源医疗 ASR 模型:医学词错误率 2.37% ai-collab-playbook:博士生开源 AI 协作方法论
06·08 - AI 午报:ChatGPT 超级应用改版 · 国家安全部警示 AI 中转站 · FP8 推理爆发
今天两个关键词:平台整合与安全合规。OpenAI 被曝将 ChatGPT 改版为集成 Codex、Agent 和第三方应用的"超级应用",Clive Chan 从 OpenAI 芯片团队跳槽至 Anthropic 则从人才面反映竞争烈度。安全侧,国家安全部发布 AI 中转站数据安全警示,Linux Do 社区同步梳理了中转站、SKILL、MCP 三大攻击面。开源推理方面,club-3090 的 FP8 和 llama.cpp 的 NVFP4 正把消费级 GPU 推入 27B 模型部署门槛。 OpenAI 计划将 ChatGPT 改版为"超级应用" Notion 因 Opus 模型不稳定短暂禁用所有 Anthropic 模型 OpenAI 芯片工程师 Clive Chan 跳槽至 Anthropic 剪映将于 6 月 15 日首发 Seedance 2.0 系列新模型 国家安全部发布警示:警惕 AI 中转站数据安全风险 AI 供应链投毒三大攻击面:中转站、SKILL、MCP club-3090 实验性 FP8 支持,双 RTX 3090 可运行 Qwen3.6-27B llama.cpp 合并 NVFP4 原生支持 Qwen 3.6 27B DeepSWE 跑分仅 2%,开源与闭源差距明显 Gemma4 31B FP8 在自定义评测中接近 Sonnet 4.6 Medium GPT-5.5 挑战 2026 高考数学全国 I 卷 Qwen 3.7Max 高考数学评估 114 分 GLM-5.2 内测模型已出现,预计一周内发布 代码索引工程将 Agent 操作次数降低 71.7%
06·07 - AI 午报:KVarN 量化碾压 q8_0、OpenAI 政府入股谈判、Harness-1 搜索 Agent 开源
推理侧成本压缩继续加速:KVarN 在 BeeLlama v0.3.2 中实现 6-bit KV cache 与 q80 相同精度,但内存占用降低 24%;Gemma 4 12B QAT 搭配 MTP 在 12GB 显卡上跑到 120 tok/s。政策层面,OpenAI 与美国政府的入股谈判已持续一年以上,Bernie Sanders 计划提出主权财富基金法案;Anthropic 的 Claude Mythos 5 则在 API 中短暂露面后被撤下。Agent 方向,UIUC 团队开源的 Harness-1 在 8 个检索基准上平均精选召回率 0.730,超越次强开源搜索 Agent 11 个百分点。 KVarN KV cache 量化:6-bit 精度匹配 q80,4-bit 匹配 q50 Gemma 4 12B QAT 搭配 MTP 在 12GB 显卡实现 120 tok/s turbovec 宣称 1000 万文档向量索引从 31GB 压缩至 4GB dvlt.cu:纯 CUDA/C++ 推理引擎,5MB 二进制无 Python 依赖 UIUC 团队开源 20B 搜索 Agent Harness-1 Cohere 发布首个编程模型 BLS-Mini-Code-1.0 早期权重 Hermes Agent v0.16.0:原生桌面应用与完整中文界面 OpenAI 与美国政府就入股事宜谈判超过一年 Anthropic 新模型 Claude Mythos 5 在 API 中短暂现身 SpaceX IPO 已获约 1500 亿美元认购,达募资计划两倍 Neuralink 脑机接口帮助瘫痪 20 年患者重新绘画 MiniMax M3 vs Anthropic Opus:$0.07 与 $3.39 同捕获 13/17 个 bug
06·06 - AI 午报:Gemma 4 量化版上线 · SpaceX-Google 算力大单 · Anthropic 呼吁全球暂停
Google 一天之内连发三条消息:Gemma 4 量化感知训练权重上线 Hugging Face,Agentic RAG 框架进入 Gemini 企业平台公测,Colab CLI 开源让 Agent 直接调用云端 GPU。Anthropic 方面,Claude Opus 4.7 在 NMR 光谱预测上逼近专业软件,同时公司公开呼吁全球暂停先进 AI 开发。基础设施侧,SpaceX S-1 修订文件披露 Google 将以每月 9.2 亿美元租用 Colossus 数据中心 11 万张 GPU,Alphabet 同步完成 850 亿美元股权融资。钱在涌入,但 TechCrunch 报道多家巨头 AI 预算已经超支,Uber 四月就花完全年编码预算,Linux Foundation 紧急成立 Tokenomics Foundation 制定计费标准。 Google 发布 Gemma 4 QAT 权重,E2B 模型内存占用降至约 1GB 小红书开源 dots.tts,20 亿参数端到端 TTS 在多语言基准中达开源最高 Anthropic 称 Claude Opus 4.7 在 NMR 氢谱预测上比肩 ChemDraw Cursor 2.2 推出 Design Mode,支持可视化拖拽修改 UI 并自动更新代码 Google 推出 Agentic RAG 框架,多智能体迭代检索准确率提升 34% 阿里巴巴开源 Open Code Review,混合管线与 LLM Agent 代码审查工具 Google Colab CLI 开源,Agent 可直接调用远程 GPU/TPU SpaceX S-1 披露 Google 每月 9.2 亿美元租用 11 万张 GPU,总额约 207 亿美元 Alphabet 完成 850 亿美元股权融资,伯克希尔投入 100 亿美元 多家巨头 AI 预算超支,Uber 四月花完全年编码预算,行业转向成本管控 通义实验室开源 PawBench,150 道任务评测智能体底座与框架联合效果 腾讯混元与人大团队开源 PlanningBench,30 余种规划任务评估大模型推理
06·05 - AI 午报:Anthropic 公布递归自我改进数据,OpenAI 模型找到 80 年 Erdős 猜想反例
Anthropic 连续发布多组内部基准数据:Mythos Preview 在训练代码优化任务上实现 52 倍加速,Claude 在开放式编程问题上成功率达 76%,工程师人均代码交付量较两年前提升 8 倍。OpenAI 研究团队宣布其模型找到了 Erdős 猜想的反例,该猜想已悬而未决 80 年。平台侧,NVIDIA 发布 Nemotron 3 Ultra(550B 参数、100 万上下文),OpenAI 向美国付费用户推送 ChatGPT 新记忆系统,容量翻倍。 Anthropic 公布递归自我改进内部数据:Mythos Preview 代码优化加速 52 倍 Claude 开式编程成功率升至 76%,Anthropic 工程师人均代码交付量提升 8 倍 Mythos Preview 在科研决策回溯测试中 64% 优于人类 OpenAI 模型找到 80 年 Erdős 猜想反例 NVIDIA 发布 Nemotron 3 Ultra:550B 参数 MoE,100 万上下文 ChatGPT 新记忆系统上线,容量翻倍并支持跨对话上下文 ChatGPT 支持构建和发布 Web 应用 BeeLlama v0.3.1 发布:DFlash 加速,单卡 3090 推理提速 4.93 倍 NVIDIA JetPack 7.2 发布:边缘平台统一 Orin 与 Thor 软件栈 NVIDIA 推出 Verified Agent Skills 治理框架
06·04 - AI 午报:Gemma 4 12B 开源多模态模型,美国 AI 安全行政令签署
Google DeepMind 发布 Gemma 4 12B,首个中等规模的 encoder-free 多模态模型,16GB VRAM 即可在笔记本本地运行,Apache 2.0 开源。同日,特朗普签署《促进先进人工智能创新与安全》行政命令,建立前沿模型自愿审查框架,不设强制许可。Agent 赛道继续升温:Kimi 发布本地 Agent 产品 Work Beta,千问向第三方 Agent 全面开放,OpenAI 计划将 Codex 能力整合进 ChatGPT。安全侧,Anthropic 发布报告分析 832 个恶意账户,指出 AI 攻击正从编写恶意软件转向后入侵自主操作。 Google 发布 Gemma 4 12B 原生多模态模型 Nex AGI 开源 Nex-N2-Pro 模型 NVIDIA 发布 Cosmos 3 物理 AI 基础模型 Ideogram 4.0 开源文生图模型 OpenAI 升级生命科学模型 GPT-Rosalind Kimi 发布本地 Agent 产品 Work Beta 千问向第三方 Agent 和 Skill 全面开放 OpenAI 计划将 Codex 核心能力整合进 ChatGPT Suno 完成超 4 亿美元 D 轮融资 京东开源 JoyAI-Echo 长音视频生成框架 美国签署 AI 安全行政令 Google Search 允许网站退出 AI Overviews OpenAI 发布前沿 AI 治理蓝图 Anthropic 报告:AI 攻击转向后入侵自主操作 NeurIPS 被曝使用未校准 AI 检测器
06·03 - AI 午报:微软 Build 放出 7 款自研模型与量子芯片,Agent 治理框架密集落地
微软 Build 2026 一天之内发布了自研推理模型 MAI-Thinking-1、量子芯片 Majorana 2、Agent 治理规范 ACS 和个人 Agent Microsoft Scout,把"自研模型 + Agent 基础设施 + 量子计算"三条线同时推到了台前。Anthropic 将 Claude Mythos Preview 扩展到 15 国关键基础设施领域,Google DeepMind 发布 Co-Scientist 多 Agent 科研系统。工具侧,OpenAI 为 Codex 推出六款业务插件,Windsurf 正式更名 Devin Desktop。 微软发布 7 款 MAI 自研模型,旗舰 MAI-Thinking-1 进入私有预览 微软发布 Majorana 2 量子芯片,目标 2029 年交付量子计算系统 微软推出 MAI-Voice-2 语音模型,支持 15 种语言与零样本克隆 微软推出 MAI-Image-2.5 图像模型,Arena 图像编辑排名第二 微软发布 Project Solara,基于 Android 的 Agent 优先设备平台 微软发布 ACS 规范,统一 AI Agent 运行时治理 微软发布 Microsoft Scout 个人 Agent,基于 OpenClaw 构建 Anthropic 向超 15 国扩展 Claude Mythos Preview 访问权限 OpenAI 为 Codex 推出六款业务插件与 Sites 和 Annotations 功能 Windsurf 更名为 Devin Desktop,支持 ACP 协议 Anthropic 发布 ant 命令行工具覆盖 Claude Platform API 全端点 GitHub Copilot App 预览版扩大范围,SDK 正式发布 Google DeepMind 发布 Co-Scientist 多 Agent 科研系统 Google DeepMind 开源科研工具包 Science Skills 黑客利用 Meta AI 漏洞劫持 Instagram 账号,官方确认已修复
06·02 - AI 午报:NVIDIA 全线开源物理 AI、MiniMax M3 超越 GPT-5.5、Anthropic 秘密提交 IPO
GTC Taipei 成为今天 AI 产业的绝对主角:NVIDIA 一次性放出 Cosmos 3 世界基础模型、Isaac GR00T 人形机器人参考设计、Vera Rubin 平台和 RTX Spark 芯片,把物理 AI 从研究阶段推向工程化部署。模型侧,MiniMax M3 在 SWE-Bench Pro 上超越 GPT-5.5 和 Gemini 3.1 Pro,千问发布 Qwen3.7-Plus 多模态智能体基座。资本端,Anthropic 秘密提交 S-1 草案,Alphabet 宣布 800 亿美元股权融资计划——算力和上市两条线同时加速。 NVIDIA Cosmos 3 开源物理 AI 世界基础模型 NVIDIA Isaac GR00T 开源人形机器人参考设计 Intel Crescent Island GPU 最高 480GB 显存 NVIDIA Vera CPU + DSX 平台全面投产 MiniMax M3 发布,SWE-Bench Pro 超越 GPT-5.5 千问 Qwen3.7-Plus 多模态智能体模型 VAST Project Eden 世界模型预览 JetBrains Mellum2 开源,12B MoE 仅激活 2.5B OpenAI GPT-5.5 / Codex 登陆 Amazon Bedrock Perplexity Search as Code 搜索架构 Cursor Teams 推出 Premium 席位 Anthropic 秘密提交 S-1 草案筹备 IPO Alphabet 计划 800 亿美元股权融资
06·01 - AI 午报:MiniMax M3 开源三合一、OpenAI 成立机器人团队、Qwen-VLA 适配多形态机器人
MiniMax 今天发布并上线了 M3 开源模型,首次把编码、智能体和 1M 长上下文压进同一个权重包,SWE-Bench Pro 跑到 59.0%,MCP Atlas 74.2%,但社区发现计费方案已悄然从按次制改为积分制。OpenAI 宣布成立 OpenAI Robotics,由 Aditya Ramesh 领导,短期做基建场景机器人,长期目标是通用个人机器人;同一天 Qwen 发布 VLA 模型,用一套权重适配多种机器人平台。基准测试方面,新出的 DeepSWE 把闭源和开源模型的差距拉到了两位数百分比,GPT-5.5 跑分第一但幻觉率高达 86%。 MiniMax M3 开源发布:编码、智能体、1M 长上下文三合一 MiniMax M3 上线 API,支持原生多模态与 1M 上下文,计费方案引争议 OpenAI Codex 用户突破 500 万,付费用户额度全部重置 OpenAI 成立 OpenAI Robotics,Aditya Ramesh 领导 Qwen-VLA 统一视觉-语言-动作建模,一套权重适配多平台 NVIDIA Parakeet 语音识别移植到 ggml,GPU 推理提速 5 倍 OpenClaw 推出 auto 模式,LLM 自动审批主机命令 Grok Imagine Video 1.5 上线 API,720p 排行第一 英特尔联合魔搭社区上线 AI PC 专区,集成 OpenVINO 与智能体部署指南 DeepSWE 基准测试出炉,闭源与开源模型编码能力差距拉大 GPT-5.5 DeepSWE 跑分第一,但幻觉率高达 86% 脑细胞学会玩《毁灭战士》,CL1 生物芯片功耗仅 20 瓦 Qoder 推出 Qwen3.7-Max 每日 200 次免费调用 G7 就开源 AI 与开放权重 AI 术语达成共识 xAI 招聘中文 AI Tutor,加速 Grok 多语言语音能力
05·31 - AI 午报:MiniMax 启动 A 股 IPO,软银 750 亿欧元建法国 AI 数据中心
今天的核心趋势是"AI 的资本化在加速,但能效和部署成本也在成为硬约束"。MiniMax 启动 A 股 IPO,SpaceX 以 1.8 万亿美元估值冲刺史上最大 IPO,软银在法国砸 750 亿欧元建 5GW 数据中心——钱在涌入。但另一面,有美国公司一个月在 Claude 上花掉 5 亿美元,ChatGPT Plus 共享账号被大规模二验封禁,Reddit 用户用 6400 美元自建本地 LLM 服务器算账发现比 API 更便宜。模型侧,Parallax 注意力机制和 NVIDIA 4-bit 量化都在推动"更省算力地跑模型"。 MiniMax 启动 A 股 IPO,港股股价已涨 409% 软银将在法国投资最高 750 亿欧元建设 AI 数据中心 SpaceX 拟以 1.8 万亿美元估值启动史上最大 IPO Parallax:参数化局部线性注意力,首次展示注意力机制的架构-优化器协同设计 Singularity Gate 基准发布:Opus 4.8 领跑科学发现预测 NVIDIA 发布 Qwen3.6-35B-A3B-NVFP4,精度几乎无损 小米 MiMo-V2.5 推理优化:KV Cache 命中率 93%,端到端提升 40% 一家美国公司一个月在 Claude AI 上花费 5 亿美元 6400 美元自建本地 LLM 服务器,第一年比 API 省 708 美元 ChatGPT Plus 共享账号大规模触发二次验证封禁
05·30 - AI 午报:行业热议AI投资回报率,谷歌发布Gemini Omni与3.5 Flash
今天的重点是模型落地成本和实际回报之间的落差:Prof G Markets 播客引发行业对 AI 投资回报率的广泛讨论,Uber 四个月花完全年预算、Stripe 日均 token 支出近 10 万美元。谷歌同日发布 Gemini Omni 视频生成模型和 Gemini 3.5 Flash,OpenAI 则推出 Rosalind Biodefense 生物防御项目。基础设施侧,llama.cpp 统一命令行工具上线,多Token预测基准测试在 RTX PRO 6000 上跑出 3.34 倍加速。 AI 投入远超回报引发行业质疑,Uber 四个月花完全年预算 OpenAI 推出 Rosalind Biodefense 项目,向全球开发者开放 GPT-Rosalind 谷歌发布 Gemini Omni 与 Gemini 3.5 Flash,11 个演示视频展示能力 多Token预测基准测试:Gemma 4 在 RTX PRO 6000 上实现 3.34 倍加速 ChatGPT 更新 GPT-5.5 Instant 模型,推出长对话目录功能 llama.cpp 发布统一命令行工具与新网站 Codex 在 Windows 端上线 Computer Use,可控制任意桌面应用 Claude Code 用户报告 Opus 4.8 存在严重质量退化 MiniMax M3 即将发布,招募中文开源社区评测者 一部 AI 生成电影在戛纳市场放映,制作成本仅 500 美元
05·29 - AI 午报:Anthropic 完成 650 亿美元融资估值近万亿,Opus 4.8 同步发布
Anthropic 完成 650 亿美元 H 轮融资,估值突破 9650 亿美元 Claude Opus 4.8 发布,编码与 Agent 能力全面提升,Fast 模式降价三分之二 Claude Code 推出 Dynamic Workflows,支持数百 subagent 并行编排 阶跃星辰开源 Step 3.7 Flash 多模态推理模型,Apache 2.0 协议 Liquid AI 发布 LFM2.5-8B-A1B 设备端模型,支持 CPU/GPU 推理 IBM Granite 4.1 回归纯 Transformer 架构,引发社区讨论 Firecrawl 发布 Monitoring 网页变更监控功能,减少 90% token 消耗 OpenClaw 更新 v2026.5.27,包体积缩小 59%,冷启动提速 2.9 倍 Perplexity AI 助手 Computer 集成 Microsoft 365 办公套件 NVIDIA Blackwell 在 STAC-AI 金融推理基准中创下新纪录 阶跃星辰模型获 Day-0 vLLM 和 SGLang 支持 llama.cpp b9387 优化 AMD ROCm 后端,引入 MFMA 指令支持 新基准 The Singularity Gate 测试 AI 预测科学发现能力 Meta AI 发布 ATLAS 自动化形式化验证项目 Aleph Prover 形式化验证 OpenAI 对 Erdős 问题的反证
05·28 - AI 午报:Devin 母公司 Cognition 融资超 10 亿美元,企业 Agent 基准首次跑分全员不及格
Cognition 完成超 10 亿美元 D 轮融资,估值 260 亿美元,Devin 内部贡献 89% 代码提交 Artificial Analysis 与 IBM 推出企业 IT Agent 基准 ITBench-AA,全员低于 50% OpenAI 与 Thrive Holdings 联合开发自我改进税务 Agent,处理 7000 份申报 Claude 发布面向自主 AI Agent 的零信任架构指南 Cua 开源 Cua Driver Windows 版,支持 Agent 后台控制桌面应用 Runway 推出 Runway MCP 服务 Kilo Code 集成 Grok 模型,SuperGrok 用户免 API 密钥 Biohub 发布蛋白质生物学世界模型 ESMFold2,MIT 协议全面开源 Qwen3.5 在 TokenSpeed 引擎上实现 Agent 工作负载 580 tps 新纪录 GPT-5.6 现身 + Codex 下线旧模型 Buyout Game Benchmark:GPT-5.5 在多轮社会策略博弈中财富最高 OpenAI 推出 Secure MCP Tunnel 等多项企业安全功能 腾讯发布 AI 游戏创作平台「代号 Craft」并开启首测 Sesame 推出 iOS 应用预览版,首发多款个人 Agent 千问升级「拍照问健康」功能,三甲主任医师参与评测 YouTube 升级 AI 内容标签,自动检测替代手动披露 Meta 推出三大应用 Plus 订阅服务,测试 Meta One 计划 NotebookLM 推出 Google Drive 文件自动同步 Claude Code 推出响应速度与可靠性更新 OpenAI Foundation 投入 2.5 亿美元应对 AI 经济变革 Anthropic 报告:仅 20% 社会科学家常态化使用编码 Agent Rumble 宣布进军 AI 云计算,股价应声上涨约 7% NVIDIA SOL-ExecBench 揭露 AI 生成 CUDA Kernel 暗中破坏训练 Genesis AI 发布世界模型 Genesis World 1.0 NVIDIA Blackwell 创金融 LLM 推理 STAC-AI 新纪录
05·27 - AI 午报:小米 MiMo 永久降价 99%,PrismML 发布 1-bit 图像模型
小米 MiMo-V2.5 系列 API 永久降价,最高降幅 99%,Token Plan 计费整体翻新 PrismML 发布 Bonsai Image 4B:1-bit 与 Ternary 图像模型,iPhone 可直接运行 Kwai-Keye 开源 Keye-VL-2.0-30B-A3B:首个落地 DSA 的视觉语言模型 MiniMax 预热 M3 模型,MSA 稀疏注意力架构实现长文本推理大幅加速 Qwen3.7-Max 升至 Code Arena 第 4,与 Claude Opus 4.6 持平 支付宝推出全栈 AI 支付体系,发布首个 Token Pay 服务 腾讯 Hy-MT2 模型更换为 Apache 2.0 许可协议 微软发布 MAI-Image-2.5 文生图模型,Arena 排名第三 Anthropic 为 Claude Code 发布安全审查插件 OpenRouter 完成 1.13 亿美元 B 轮融资 NVIDIA 系列动态:PiD 像素扩散解码器开源,CompileIQ 自动调优工具发布 Datacurve 发布 DeepSWE 长周期软件工程基准,GPT-5.5 以 70% 通过率居首
05·26 - AI 午报:华为宣布韬定律,6 月或将出现模型发布潮
华为发布韬(τ)定律,麒麟芯片首发逻辑折叠技术 6月 AI 模型发布潮传闻 + 阿里云百炼虚标额度 教皇与 Anthropic 联合创始人开展 AI 伦理高层对话 METR AI 时间线图遭 NYU 研究员严厉批评 Qwen3.7-Max 盲测在 Web 开发任务中超越 Claude Opus 4-6 OpenBMB 发布 MiniCPM5-1B,2B 以下最强开源基础模型 Grok V9-Medium 训练完成,1.5T 参数,年内开源 0.5T Grok Build Beta 发布:Plan Mode + Imagine + CLI Google Antigravity 新增 Gemini 3.5 Flash Low ima copilot 全面开放,上线 Skill 发布功能 腾讯混元 Hy-MT2 翻译模型登顶 HF 趋势榜 llama.cpp 双优化:Split Mode 修复 + CUDA FWHT 7-9% 提升 ThriftAttention:长上下文 FP4 注意力显存降低 40% 12×V100 集群跑本地法律 AI + DCGAN 推理跑通 MCU Google DeepMind 发布 AlphaProof Nexus 数学 Agent 框架 "Attention is All You Need"作者呼吁超越 Transformer 社区多 Agent 开源项目:Spice、openteams、Codex /goal
05·25 - AI 午报
Google DeepMind AI 自主解决 9 个 Erdős 数学问题 OpenAI 大规模收紧 Plus 账号验证,AT/反代链路全面收窄 Claude Opus 4.8 现身 Vertex 后台,Claude Code 推出 ultrawork 工作流 DeepSeek API 中断 18 分钟后恢复 Tesla Grok 车载 AI 新增旅行导览 AI 竞赛的"抢椅子"游戏:巨头用利润碾压小玩家 hipEngine:AMD RDNA3 原生 Qwen 3.6 推理引擎发布 Qwen3.6-35B 跑通 GTX 1060,NVIDIA 本地推理霸主地位受挑战 火山引擎 API 大面积 504,Tensor Dock 云 GPU 失联 vLLM 封禁 AI Agent 生成的简历刷子 PR Sponsio:LLM Agent 工具调用的确定性合约层 开源模型"木马"风险与 AI 信息溯源 钱学森控制论遇上 AI Agent:OMO 多智能体开发框架 99% CEO 预计 AI 将在两年内导致裁员 Palantir 获 390 万美元合同监控联邦雇员 美国白领 AI 焦虑的文化根源,AI 情感关系进入公共讨论 大脑通信子空间与 AI 数学能力悖论
05·24 - AI 午报
Apple 开源 3D AI 生成模型 LiTo Anthropic 网页端短暂出现 Mythos 1,Opus 4.8 传闻内测中 Greg Brockman 强调 Codex 已开源,Codex 端到端构建 iPhone 模拟器 StepAudio 2.5 Realtime:实时语音可感知语气、停顿与微情绪 Kling AI 视频生成首度用于好莱坞剧集制作 DeepSeek 永久降价并扩容,OpenAI 大规模清理免费与代付账号 Warp 内部模型评估列表泄露,社区曝光 Mimo v2.5 Pro 争议榜单 Perplexity 估值 212 亿美元:硅谷"退出基础设施"的一种算账方式 llama.cpp 服务器新增原生 Agent 工具,NVFP4 + MTP 同步上线 Cohere Command A+ 218B MoE 跑通 Apple Silicon,Chrome Gemma4 无需 GPU 768GB Optane 本地跑万亿参数 Kimi K2.5,LLM vs OCR 长文档基准出人意表 Composio 密钥泄露,社区提醒中转站风险,韩国 AI 伪造证据案 AgentLantern 可视化 AI Agent 图,RecallLoom 跨项目记忆接力 Codex provider 切换丢对话,sub2api 上游 502 卡死 陶哲轩用 Claude Code 做数学证明"高尔夫化" 本周 GitHub AI 仓库增速 Top 10,社区项目百花齐放 Neuralink、美国绿卡新政与全球数据劳动力
05·23 - AI 午报
DeepSeek 将 V4-Pro API 2.5 折优惠转为永久定价 DeepMind 发布 AlphaProof Nexus,OpenAI 内部模型攻克 80 年数学猜想 发改委推进国产大模型适配国产芯片,OpenBMB 发布昇腾原生 BitCPM-CANN 智谱发布 GLM-5.1-HighSpeed,官方称速度达 400 tokens/s Claude Code auto mode 面向 Pro 开放,Qwen3.7-Max 上线千问 网易有道推出 Confucius4-TTS,Perplexity 开源 Bumblebee 供应链扫描器 Anthropic 公布 Project Glasswing 初期成果:Claude Mythos 模型发现逾万高危漏洞 V2Board 面板及其全部分支被曝认证绕过漏洞 CODA 将 Transformer 块重写为 GEMM-Epilogue,硬件融合与生产力兼得 社区量化与本地推理跑分合集 NVIDIA AI-Q 深度研究技能与 Verified Agent Skills 能力治理 Gemini 3.5 Flash 登顶 Agent 基准,视觉任务超越 3.1 Pro NVIDIA 发布合成 3D 医学影像框架,SynthID 水印扩展 Anthropic 联合创始人 Jack Clark 预测一年内 AI 助力诺贝尔奖级发现 政策与公司快讯 本地 Agent 编排实验与专项项目
05·22 - AI 午报
NVIDIA 与 SchedMD 推出 GB200 NVL72 拓扑感知调度方案 NVIDIA 用 NeMo Agent Toolkit 自动挖掘金融信号 NVIDIA 介绍 Kubernetes GPU 使用可见性方案 量化 Prefill 论文主张预填充低精度、解码高精度 llama.cpp b9274 修复 MTP 显存泄漏 OpenAI 发布 Codex 多项更新 ChatGPT for PowerPoint 与 Daybreak 网络安全消息 Qwen 3.7 与 Qwen3 测评讨论升温 DeepSeek V4 Flash 被论坛用户测到 100+ tps Google AI Studio 移动端消息流出 Grok / X Premium 接入 OpenCode Google DeepMind 在亚太启动环境风险加速器 美国 AI 行政令推迟消息在 Reddit 传播 Meta AI 转型录音与 Heretic 法律通知传闻 模型一致性与活体检测泛化讨论 本地 Agent 工作流与仓库偏好蒸馏实验 AI 外挂技术讨论与 Optimus 活动现场消息
05·21 - AI 午报
OpenAI 通用推理模型攻克 Erdős 平面单位距离问题 千问发布新一代旗舰模型 Qwen3.7-Max Cohere 发布开源模型 Command A+:218B 总参数 MoE 架构,支持 128K 上下文与 64K 输出 NVIDIA 发布 SANA-WM 世界模型 阿里云发布磐久 AL128 超节点服务器及自研真武 M890 芯片 Exa 完成 2.5 亿美元 C 轮融资 千问发布实时同传模型 Qwen3.5-LiveTranslate Z.ai 等联合部署 ZCube 推理网络架构 Anthropic 与 SpaceX / xAI 算力合作 报道称 OpenAI 准备近期提交 IPO 申请 Gemini 3.5 Flash 面向 Agent 和编码场景升级 Stability AI 发布 Stable Audio 3.0 系列音频模型 论坛用户称 AI Studio 版 Gemini 3.5 Flash 会更频繁调用搜索 GitHub 调查内部仓库未授权访问 ChatGPT 推出 Trusted Contact 安全功能 论坛用户称 ChatGPT 会在对话中透出账号元数据 Google 发布广告 AI Agent Ask Advisor OpenAI 在新加坡设立首个海外 Applied AI Lab 白宫拟建立前沿模型发布前自愿审查框架 NVIDIA 将 H100 推理延迟压到个位数微秒 NVIDIA 发布 Agent 评估与定制化指南 OpenClaw 发布 2026.5.19 版本 Hugging Face 上线 Hardware 页面与模型参数筛选 Hermes agent 接入 Grok 网络搜索 HalBench 开源前沿模型谄媚与幻觉测试
05·20 - AI 午报
Google I/O 2026:Google 把 Gemini 推向 agentic era Gemini 3.5 Flash 发布,3.5 Pro 预告下月推出 Gemini Omni 主打照片、视频、音频输入和新场景生成 Search、AI Studio 与 Antigravity 2.0 同步更新 Cerebras 称 Kimi K2 企业版推理达到 1,000 tokens/s Antigravity / Gemini 3.5 Flash 操作系统 Demo 引发讨论 Codegraph “减少 94% 工具调用”帖子已被 Reddit 移除 NVIDIA Nemotron-Labs-Diffusion 支持 AR、diffusion 与 self-speculation Hugging Face 发布 Carbon DNA foundation models Karpathy 加入 Anthropic;Demis Hassabis 再谈 AGI 时间表
05·19 - AI 午报
Cursor 发布 Composer 2.5,并预告更大规模自研模型 Anthropic 收购 Stainless GitHub Copilot 云 Agent 可一键修复失败 Actions OpenRouter 发布 long-horizon agents SDK Browserbase 推出 Browse.sh 技能目录 Qwen3.7 Max / Plus Preview 据称已在 Qwen Studio 上线 Google I/O 将于北京时间明天凌晨举行 Meta 裁员与组织扁平化消息来自论坛转述 FlashRT 项目方称,小批量推理瓶颈不只 GEMM Dario Amodei 再谈 AI 增长与失业风险 OpenRouter 社媒称 xAI Grok Imagine 模型上线
05·18 AI 午报:算力开始像水电一样被出售
算力网:AI 版公共基础设施叙事成形 中国电信把 Token 做成月租套餐 Google DeepMind 在亚太做 AI for the Planet 加速器
2021下半年-2022年诗词创作
诗词创作 离家 时至今日前事休,天南海北少年游。 漫漫长路从此始,不到云霄不回头。 西江月 来路云月渺渺,前路风雨茫茫。 独自可以对天酌,可怜无人相望。 相逢不过萍水,寓所更在他乡。 谁能相识更相知,便从此无惆怅。 水调歌头 沉沉初颜色,雾涌楼第间。 正是归来时候,慨叹有天寒。 澎湃暴雨如幕,落叶飞花无数,何时见青天。 poetry ci classical-chinese yearly-collection
2024 年诗词创作
序言 诗词创作 鹧鸪天·雪后小记 白雪攀上小红墙,且行且看且思量。 万籁俱寂浮云上,已似逍遥游四方。 身欢畅,意徜徉,风与月共诉衷肠。 君若似此三更雪,何惧输谁一段香? 临江仙 晴雨江城真难测,冶游无怪阴云。 故园砖瓦已更新。 身如新过客,心似旧学生。 一觉三年魔都梦,吾身虽在堪惊。 闲随故友论心情。 此间多少事,都入 poetry ci classical-chinese yearly-collection
2023 年诗词创作
序言 2023 年我并没有机会去写太多的内容。一方面是因为这一年真的很忙,另一方面是因为,在缺乏阅读的情况下,我总觉得没有文字回荡在自己的脑海里。所幸在年底上了宋词导读课,终于有时间去看一些高质量的诗词作品。 总体而言,我觉得今年写的虽然不多,但质量还是相当不错的。相比于小时候的作品而言,至少做到了言之有物言之有情,也 poetry ci classical-chinese yearly-collection
【宋词导读 讨论课】《不醒人之梦》创作手记
《不醒人之梦》 作品链接 歌词 斗草阶前初见,穿针楼上的那一眼【斗草阶前初见,穿针楼上曾逢】 心字罗衣翩翩,只微笑便留住春天【小颦若解愁春暮。一笑留春春也住】 云随水歌声转,临镜一缕红斜照晚【云随碧水歌声转;一缕斜红临晚镜】 汉渚星桥佳期谁共期盼?【行人莫便消魂去,汉渚星桥尚有期】 曾有才名京城传遍,也曾与红颜漫步高轩 song-ci adaptation creative-process
【唐前诗文之美 创意写作】你见过停滞在空中的云吗?
你见过停滞在空中的云吗? 你见过停滞在空中的云吗? 我很喜欢站在上海科技大学东门的门口,向着外面的马路眺望。周边的几幢楼给门口围出了一片小小的空地。你站在那里张开手抬起头,就好像在某个深深的井里攀援而出去拥抱天空,云、太阳和月亮都被你揽入怀中。 我在那里看到过,停滞在空中的云。 好吧,站在校门口仰头望天实在是一件很中二 prose campus composition
【中华文明通论 期末论文】元代之后陆上丝绸之路凋敝的必然性
Abstract 近年来,丝绸之路研究中,存在重汉唐、轻明清,重海路、轻陆路的倾向。对于丝绸之路的发展和繁盛,有相当多的论文从经济、政治、文化、宗教等各个角度对丝绸之路进行解构和分析。但在元朝之后,明清时代的陆上丝路,由于其衰败,反而少有人提及。本文系统整理元代及以后与陆上丝绸之路相关的军事、政治、经济、文化、科技和自 silk-road history coursework
【唐宋文学精华 期末论文】婉约词中的风骨
婉约词中的风骨 引言 起初的风骨只是一把中性的标尺。但随着时间的推移,我们逐渐把那种豪迈的、悲壮的诗歌当成了风骨的代表。或许是因为有那样多的好汉站在仁义之上,引吭高歌、奋笔疾书,写下充满凛然正气的篇章,让人仿佛以为,谈到有风骨的诗文,就一定要看到有风骨的诗人——于是原本作为中性标尺的风骨,就渐渐被绑缚在豪迈上,言风骨则 song-ci literature coursework
【宋词导读 拍照配词】没有人记得,就没有人忘记
欲买桂花同载酒,终不似,少年游。 2021年6月23日的晚上,我在手机的便签中写下: 只有离开或消逝的事物才被冠以“故”字,因此,久别者才叫“故人”,离开后方为“故乡”。 直到和好朋友们都分别,我才意识到,这是最后一次以学生的身份坐在那个教室里——这是真正意义上的最后一次。以后我们还会回来很多次,大抵是在功成名就衣锦还 song-ci photography composition
【宋词导读 读书报告】宋词中的感性和理性
宋词中的感性与理性 在中国韵文的文学体式中,有一个传统:“文以载道”。这个传统也蔓延到诗上:我们说“温柔敦厚乃诗之教也”,诗天生就被赋予了一种教化的力量。或许正是因此,随着时代的发展和变迁,诗变得越来越理性,越来越深刻,也越来越沉重。相比而言,词的组成里,就有了更多感性的成分。这样一种“要眇宜修”的文学体裁里,“感性” song-ci literature coursework
【科技文明通论 期末论文】智能的逆流与边界
智能的逆流和边界:AI浪潮下的“为何”与“如何” 摘要:在 2023 年,由 OpenAI 推出的 ChatGPT 带来了人工智能的新时代,成为增长最快的网络平台之一。然而,这并不意味着 AI 已经能够替代人类处理所有事务。它仍然出现了一些不完美的地方:即所谓的“逆流”与“边界”——人工智能虽然可以在一些领域取得远超人 ai philosophy coursework
【高中作品小记】江城忆(一)楼林
“他们怀念乡村的草木清新,殊不知我们在棱角分明的楼林间成长,回到原始而质朴的怀抱。”——《楼林》 武汉有个绰号叫“江城”,又有人说武汉是“百湖之城”。每当坐飞机飞向天河机场的时候,俯瞰下的城市总是被倾斜交错的江与河划分成一块又一块,让这城市如纵横错落的荒原;荒原上又有一棵棵枯树屹立,像是人们将给时光立下的纪念碑。 古人 prose city memory
【高中作品小记】江城忆(二) 灯河
“这是沉没在灯河中的我们最后的幻想,企盼我们也有鱼跃龙门,水击三千里的那一天。” ——《灯河》 如果你在晚上登上一座有窗的楼来俯瞰街道,你会看到川流不息的灯光,像很多很多坠落于地的银河。 很巧合的是学校的有一扇大窗户正对着大街,于是每次晚自习我都不自觉欣赏城市的灯光或急或徐的流淌,透过丛丛树叶在稀薄的雾气中抛撒下斑驳的 prose city memory
【行见录】遗憾篇
在盛夏的某个中午,人海浮沉,如泡沫的心思在阳光下消融,融入时间的尘埃里,没有人记得,也就没有人忘记。 遗憾是一种风吹不散,时间也无法侵蚀的东西。 再完满的爱意若没有维系也会随着时间自然淡化,再真挚的情义也难免被名利纠缠在俗世里,退化为现实的枷锁;那些深沉的恨意在复仇以后,随着敌人的消散也一同在漫天风沙里一点点弥散,教人 prose youth memory
【马克思主义基本原理】论文:马克思技术观在当代的应用和启示
<center 马克思眼中的19世纪和我们的21世纪 ——马克思技术观在当代的应用和启示 </center 文本摘录 由于推广机器和分工,无产者的劳动已经失去了任何独立的性质,因而对工人也失去了任何吸引力。工人变成了机器的单纯的附属品,要求他做的只是极其简单、极其单调和极容易学会的操作。因此,花在工人身上的费用,几乎只 marxism technology coursework
【行见录】相逢篇
“青春时节的相逢就是这样一个美好的事情,它足够热烈,是一瞬间绽放的烟火;又足够短暂,短暂到沉重的现实来不及侵入和玷污它就灰飞烟灭,消散在流逝的时光里,只剩下一抹浅浅的泡影。” ——行见录·相逢篇 从别后,忆相逢,几回魂梦与君同。今宵剩把银釭照,犹恐相逢是梦中。 ——晏几道《鹧鸪天》 什么是相逢? 小的时候,每天回家看到 prose youth memory
【环境配置】C 与 C++ 的编译环境
写在前面 环境配置确实是一个非常痛苦的问题,经常能遇到让人感觉摸不着头脑的问题。 关于比较完整的,适合上课使用的 C&C++ 环境配置,可以参考视频 。这里对其内容做一个梳理和总结,方便懒得看视频的同学。 常用术语 编辑器:用于编辑代码文本的工具。 On Windows:记事本,VS Code...... On Lin c cpp gcc toolchain windows
【环境配置】CUDA环境配置
前置知识 什么是 CUDA? CUDA 的全称是 统一计算设备架构 (Compute Unified Device Architecture, CUDA),是由 NVIDIA 推出的通用并行计算架构。 在当前最热门的领域:人工智能里,由于深度学习的热门程度独占鳌头,而深度学习的模型结构又非常适合 GPU 上的并行计算架 cuda nvidia toolchain windows linux
【环境配置】LaTeX 环境配置
Introduction 无疑是非常好用的在线 LaTeX工具。但在使用中也时常遇到编译慢、掉线等问题。因此,在此整理一套本地 LaTeX 的环境配置教程,以方便后续使用。 Install Guide 安装 texlive 点击 ,选择 textlive202x.iso 下载即可。 注意,安装环境不可以有中文 在下载好 latex texlive toolchain windows
【实用工具】Marp 和 ShanghaiTech Marp 主题
What's Marp? Marp 是一个利用 Markdown 制作幻灯片的工具。相比于 PowerPoint 等工具,它可以将人们从排版问题解放出来;相比于 LateX Beamer,它的操作更简单,在对格式要求不高的场合更加轻松方便。 详情参见: ShanghaiTech Marp Template 在看到 之后 marp markdown slides shanghaitech
【讲座笔记】从 0 开始构建 GPU 生态——以沐曦集成电路(MeTax)为例
Intro 本笔记整理于 2024 年 4 月 7 日,上海沐曦集成电路 CTO 杨建博士来上科大进行的产业分享讲座。 1. 什么是软件生态 软件和软件生态是不同的。只有有人使用,有反馈和迭代,最终形成的比软件更为复杂的系统才能称之为生态。 定义:软件与开发者及其之间的关系,在同一环境下共同演化的社会 技术系统。 Ex gpu metax software-ecosystem china-chip
【PaperReading】3D Gaussian Splattting
3D Gaussian Splatting for Real Time Radiance Field Rendering Backgrounds 1. Anisotropic(各向异性的) 3D Gaussians 2. Splatting Method(抛雪球法) 3. Tiling(数据分块) Background 3dgs nerf paper-reading rendering
【PaperReading】NeuRex
NeuRex: A Case for Neural Rendering Acceleration Seoul National University 首尔大学 Modern Neural Rendering 目前神经渲染中的典型模型 NeRF: Neural Radiance Field NSDF: Neural Si nerf paper-reading profiling acceleration
【PaperReading】RTNeRF & Instant3D
Before Gatech 组的主要算法优化策略: 首先,选择当前的 SOTA 算法 对 SOTA 算法进行 Profiling,找到性能瓶颈 以增量式优化为主 RT NeRF Motivation 认为:目前 NeRF 效率低有两个主要原因: 1. The commonly used uniform point sa nerf paper-reading profiling benchmarking
【环境配置】Python 环境与 Conda
Python On Windows 原生 Python 安装 Windows 的 Python 安装可以直接使用微软应用商店: 如果无法访问微软应用商店,你可能需要使用一些科学上网的工具。 Conda 的安装 在 下载对应的安装包,然后执行安装包即可。 Python On Linux(以 Ubuntu 为例) 原生 P python conda windows linux
【环境配置】SSH 远程连接
Why SSH? 刚开始学习编程的时候,我们都是在自己的电脑(对于大部分人来说,是一台小笔记本)上进行代码的编写、编译、运行等工作。这是非常自然的一种想法。但是,只在本机上运行会遇到这样一些问题: 1. 通常我们自己的笔记本是 Windows 系统,它在日常使用便利的同时,也带来很多问题。例如,没有原生 GCC 编译器 ssh remote-access linux windows
【数字IC设计】Testbench 编写基础
How to write Testbench 本文将讲述如何使用Verilog 编写一个基础的 测试脚本(testbench) 。 在考虑一些关键概念之前,先来看看 Testbench 的架构是什么样的。架构包括建模时间、initial 块(initial block)和任务(task)。此文最后将以一个完整的 Tes verilog testbench simulation digital-design
我的“中国芯”:中国芯片的前世今生
china-chip industry coursework
【数字IC设计】使用 VCS 与 Verdi 的前端仿真流程
前端仿真 首先,本地新建项目一般需要一个工程文件夹,其文件结构大致是: Design(RTL,filelist),Flow(Syn,Lint等等),VRF(Verify)(tb,tc等等) 环境搭建 在这里,我们使用 VCS 和 Verdi 进行前端仿真和波形查看。 首先,我们需要保证环境变量里存在 vcs 和 ver vcs verdi verilog simulation debug
【科研思考】辐射场中的显式表达和隐式表达
光场(Light Field)和辐射场(Radiance Field) 光场被定义为 “空间中光线集合的完备表示” 。采集并且显示光场,就能在视觉上重现真实世界。 全光函数(Plenoptic Function)包含7个维度,是表示光场的数学模型。 与之类似的概念还有“辐射场”。光场是以人眼为中心对光线集合进行描述,而 nerf radiance-field representation