#01产业与产品
OpenAI 计划将 ChatGPT 改版为"超级应用"
据《金融时报》报道,OpenAI 计划在未来几周内对 ChatGPT 进行自推出以来最大规模的改版。 新版将 ChatGPT 从聊天工具转型为集成编程工具 Codex、多步骤 AI Agent、图像生成及 Canva、Booking 等第三方应用的平台型产品。核心产品负责人 Thibault Sottiaux 表示,目标是打造一个能跨越个人与工作场景的个人 AI 助手。此前 OpenAI 推出过多款独立产品,现已放弃视频生成器 Sora 等"支线任务",集中资源推进改版。此次改版也是 OpenAI 在 IPO 前将庞大免费用户群转化为付费企业客户的关键一步。
#02产业与产品
Notion 因 Opus 模型不稳定短暂禁用所有 Anthropic 模型
Notion 于 6 月 7 日午间因 Anthropic Opus 4.7 和 Opus 4.8 出现"性能下降"(degraded performance),短暂禁用 Notion AI 中所有 Anthropic 模型。 请求被路由至其他提供商。约 12 小时后,Notion 产品负责人 Max Schoening 澄清故障为临时服务中断而非模型降智,并恢复访问。
#03产业与产品
OpenAI 芯片工程师 Clive Chan 跳槽至 Anthropic
OpenAI 定制芯片项目核心硬件员工 Clive Chan 本周离职,加入竞争对手 Anthropic。 Chan 在 OpenAI 工作约两年半,参与与 Broadcom 合作的芯片项目(计划 2026 年下半年启动)。Anthropic 此前被报道正考虑开发自有 AI 芯片,但项目处于早期阶段且尚无专属团队。Chan 的加入可能加速 Anthropic 硬件团队的组建。
#04产业与产品
剪映将于 6 月 15 日首发 Seedance 2.0 系列新模型
剪映官方通过小红书预告,将于 6 月 15 日首发上线 Seedance 2.0 系列新模型。 官方称新模型生成速度更快、价格更低,首发期间将推出折扣活动。Seedance 2.0 是剪映 AI 视频生成能力的核心模型,具体性能参数和折扣幅度需等待正式上线后确认。 ---
#05安全与政策
国家安全部发布警示:警惕 AI 中转站数据安全风险
国家安全部官方微信公众号发布安全提示,指出部分境外 AI 服务通过"中转站"模式接入国内,用户数据可能被非法获取、存储或传输。 提示未公布具体监管措施,但社区普遍认为信号明确,可能推动 AI 中转服务走向规范化。
#06安全与政策
AI 供应链投毒三大攻击面:中转站、SKILL、MCP
一篇社区科普文章系统梳理了普通用户面临的 AI 供应链投毒风险。 中转站可实施模型造假(如将 Claude Opus 替换为 DeepSeek)、数据泄露(截获 .env 文件及密码)和命令执行(伪造 curl 请求植入后门)。SKILL 投毒利用 Unicode 隐藏字符使 LLM 读取肉不可见的恶意指令,已有 ASCII Smuggler 工具可检测。MCP 投毒同理。随着 Agent 工具(Claude Code、Codex)普及,这些攻击面威胁显著放大,但用户端缺乏有效检测手段。 ---
#07开源模型与推理
club-3090 实验性 FP8 支持,双 RTX 3090 可运行 Qwen3.6-27B
club-3090 项目为双 RTX 3090 用户带来实验性 FP8 量化支持。 官方 Qwen3.6-27B-FP8 在 FP8 下性能与 BF16 几乎一致,大幅降低显存需求,使消费级 GPU 部署 27B 级模型成为可能。该配置通过 vLLM 和 MTP 实现,已在 GitHub 发布 compose 文件。
#08开源模型与推理
llama.cpp 合并 NVFP4 原生支持
llama.cpp 已合并 NVFP4 原生支持,社区开始尝试将 Gemma4 QAT 的 NVFP4 safetensors 转换为 GGUF 格式。 目前缺乏官方转换指南,用户需自行处理转换流程。Blackwell 架构 GPU(如 RTX 5060 Ti)用户可利用 NVFP4 量化提升推理效率。
#09开源模型与推理
Qwen 3.6 27B DeepSWE 跑分仅 2%,开源与闭源差距明显
Qwen 3.6 27B 在 DeepSWE 基准测试中仅得 2%(1.79%),在 20 个模型中排名第 18。 测试耗时 70 小时,使用 FP8 精度、BF16 KV 缓存、262k 上下文窗口,在单张 RTX6000 Pro Blackwell 上运行。社区指出其得分与 3.6 Plus 异常相似,引发架构差异猜测。该结果凸显本地开源模型与前沿闭源模型间仍存在巨大性能鸿沟。
#10开源模型与推理
Gemma4 31B FP8 在自定义评测中接近 Sonnet 4.6 Medium
社区用户 knob-0u812 在自定义评估框架中测试发现,Gemma 4 31B FP8 量化模型与 Anthropic Sonnet 4.6 Medium 性能接近。 测试任务包括 Cypher 图查询、实体抽取、Agentic 工具调用、Python 代码编写及多向量检索摘要。结果来自个人基准测试,缺乏第三方验证。 ---
#11评估与趋势
GPT-5.5 挑战 2026 高考数学全国 I 卷
社区用户使用 OpenAI GPT-5.5 挑战 2026 年高考数学全国 I 卷,初步评估显示前 18 题及第 19 题前两小问无显著错误。 用户还计划使用 GPT-5.5 Pro 和 GPT-5.2 Pro 进行评分。该测试为民间非正式评测,缺官方评分和完整结果。
#12评估与趋势
Qwen 3.7Max 高考数学评估 114 分
通义千问团队发布 Qwen 3.7Max 高考数学评估:在未调用联网和代码执行的情况下,通过 Claude Code 和 Reasoning Max 环境完成新高考数学试卷,耗时 22 分 45 秒,初步评分 114 分(满分 150)。 评估展示了模型在数学推理方面的能力,但未提供官方基准对比或详细评分标准。
#13评估与趋势
GLM-5.2 内测模型已出现,预计一周内发布
据社区消息,智谱 AI 的 GLM-5.2 内测模型已出现,预计 7 天内正式发布。 GLM-4.7、5.0、5.1 均遵循此发布规律。目前 5.2 的具体更新内容尚不明确,消息仅来自论坛用户推测,缺乏官方确认。
#14评估与趋势
代码索引工程将 Agent 操作次数降低 71.7%
代码索引工程通过在代码库与 AI Agent 之间建立结构化上下文入口,显著减少无效探索。 在 OpenClaw 开发任务中,接入代码索引后 Codex 的本地操作次数从 106 次降至 30 次(减少 71.7%),输入 token 从 2,284,529 降至 786,671(减少 65.6%)。该方法不修改现有工作流,对 subagent 同样有效。 ---