返回日报索引

AI DAILY / 2026-06-04

06·04 - AI 午报:Gemma 4 12B 开源多模态模型,美国 AI 安全行政令签署

Google DeepMind 发布 Gemma 4 12B,首个中等规模的 encoder-free 多模态模型,16GB VRAM 即可在笔记本本地运行,Apache 2.0 开源。同日,特朗普签署《促进先进人工智能创新与安全》行政命令,建立前沿模型自愿审查框架,不设强制许可。Agent 赛道继续升温:Kimi 发布本地 Agent 产品 Work Beta,千问向第三方 Agent 全面开放,OpenAI 计划将 Codex 能力整合进 ChatGPT。安全侧,Anthropic 发布报告分析 832 个恶意账户,指出 AI 攻击正从编写恶意软件转向后入侵自主操作。

15 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与开源

Google 发布 Gemma 4 12B 原生多模态模型

Google DeepMind 正式发布 Gemma 4 12B,这是 Gemma 家族首个支持原生音频输入的中等规模多模态模型。 该模型采用无编码器的统一架构,直接将图像和原始音频信号输入 LLM 主干,无需传统视觉或音频编码器,降低了处理延迟。模型支持 sliding window attention,窗口大小 1024,上下文长度 256K。 Gemma 4 12B 仅需 16GB VRAM 即可在消费级笔记本本地运行,官方称其基准性能接近 26B MoE 模型,内存占用不到一半。模型权重已在 Hugging Face 和 Kaggle 开源,采用 Apache 2.0 协议,支持 LM Studio、Ollama、llama.cpp 等工具。官方同步发布 Gemma Skills 技能库,面向 Agent 开发场景。Gemma 4 系列累计下载量已超 1.5 亿次。

#02模型与开源

Nex AGI 开源 Nex-N2-Pro 模型

Nex AGI 发布并开源 Nex-N2-Pro,该模型基于 Qwen3.5-397B-A17B 后训练,采用 Agentic Thinking 框架,统一推理、工具使用与环境执行。 官方公布的评测数据显示,Nex-N2-Pro 在多项基准测试中表现与 GPT-5.5、Opus 4.7 等顶级模型相当,尤其在编码和长程任务上表现突出。 模型权重已在 Hugging Face 和 ModelScope 开源。SiliconFlow 平台已上线该模型并限时免费开放 API 调用。

#03模型与开源

NVIDIA 发布 Cosmos 3 物理 AI 基础模型

NVIDIA 发布 Cosmos 3,一个面向物理 AI 的前沿基础模型,融合物理推理、世界建模与动作生成能力。 该模型帮助机器人、自动驾驶车辆和智能空间理解实时环境、预测未来状态并生成具体动作,面向具身智能系统的开发与部署场景。 Cosmos 3 将物理 AI 的能力从感知层面扩展到推理与行动层面,开发者可通过 NVIDIA 的 cookbook 和 API 集成到机器人和自动驾驶工作流中。

#04模型与开源

Ideogram 4.0 开源文生图模型

Ideogram 发布首个开源文生图基础模型 Ideogram 4.0,参数量 9.3B,采用完全单流 Diffusion Transformer 架构。 模型引入结构化 JSON 提示词接口,原生支持边界框布局控制和十六进制颜色代码,最高 2048 分辨率图像生成。 在 Arena.ai 文生图榜单中,Ideogram 4.0 排名第八,是排名最高的开源模型。模型权重已在 Hugging Face 以非商用许可公开,用户也可通过官方 API 进行商用部署。

#05模型与开源

OpenAI 升级生命科学模型 GPT-Rosalind

OpenAI 为 GPT-Rosalind 模型系列引入新能力,整合 GPT-5.5 的 agentic coding 和工具使用能力,增强药物发现及实验工作流智能。 官方公布的评估数据显示,在药物化学、基因组学和湿实验室排错等自建基准测试中,GPT-Rosalind 的表现优于 GPT-5.5、Gemini 3.1 Pro 和 Grok 4.3。 OpenAI 同步推出 Life Sciences Research 和 Life Sciences NGS Analysis 插件,所有用户可在 Codex 中使用。更新后的模型通过受信任访问部署结构向全球符合条件的组织开放研究预览版,Novo Nordisk 是其重要合作伙伴。 ---

#06Agent 与产品

Kimi 发布本地 Agent 产品 Work Beta

Kimi 官方发布本地 Agent 产品 Kimi Work Beta 版,面向知识工作者,内核基于 Kimi Code。 产品内置浏览器操作方案 Kimi WebBridge,支持自然语言拆解任务与调用工具,最高可创建 300 个子 Agent 并行协作。官方称 92% 客户端代码由 AI 生成。 Mac 版已开放下载,Windows 版即将上线。

微信公众号 · 2026-06-04原文
#07Agent 与产品

千问向第三方 Agent 和 Skill 全面开放

千问宣布向第三方 Agent 和 Skill 全面开放,瑞幸咖啡、肯德基、蜜雪冰城、东方航空等首批企业正在测试并陆续上线。 未来所有企业可在千问 APP 中运营自定义品牌 Agent,自定义人设与服务边界,以对话形式提供服务。 Agent 具备记忆与主动规划能力,可在特定场景下主动提供行程提醒、复购推荐等服务。

微信公众号 · 2026-06-04原文
#08Agent 与产品

OpenAI 计划将 Codex 核心能力整合进 ChatGPT

OpenAI 在「Intelligence at Work」直播中宣布,将在未来几周内将 Codex 的核心 Agent 能力直接整合进 ChatGPT。 整合后,用户无需在独立产品间切换,即可在桌面端、移动端和浏览器中调用 Agent 功能。ChatGPT 还将联动 Excel、Slack 和 PowerPoint 等企业工具,从对话入口升级为统一工作界面。 具体技术细节和发布时间尚未确认。

#09Agent 与产品

Suno 完成超 4 亿美元 D 轮融资

AI 音乐生成平台 Suno 宣布完成超 4 亿美元 D 轮融资,投后估值达 54 亿美元。 本轮由 Bond Capital 领投,多家新投资方和现有投资方跟投。资金将用于帮助更多用户进行音乐表达,计划在未来几个月内推出与音乐产业合作开发的首个音乐模型。 Suno 近期已登顶多国 App Store 音乐分类榜首,其应用场景已扩展至临终关怀、心理治疗等情感领域。

#10Agent 与产品

京东开源 JoyAI-Echo 长音视频生成框架

京东 Joy Future Academy 开源了长音视频生成框架 JoyAI-Echo,支持生成长达 5 分钟的连贯多镜头故事。 该框架采用跨模态音视频记忆库技术,能在多镜头切换中保持角色外观与声音音色的一致性。结合分布匹配蒸馏(DMD),生成速度较原流程提升约 7.5 倍。 用户评测显示,在长视频生成上,视觉美学、音频质量、提示遵循和 IP 一致性等指标的用户偏好度均优于 HappyOyster。项目基于 LTX-2.3 开发,代码与权重已在 GitHub 和 Hugging Face 开源,仅限学术研究与非商业用途。 ---

#11政策与治理

美国签署 AI 安全行政令

美国总统特朗普于 2026 年 6 月 2 日签署《促进先进人工智能创新与安全》行政命令,建立针对前沿 AI 模型的自愿审查框架。 命令要求联邦机构在 60 天内制定"受保前沿模型"的评估标准,开发商可在公开发布前最多 30 天自愿提交模型供政府安全评估,明确不设立强制许可或预审批。 命令还要求在 30 天内优先升级国家安全系统和关键基础设施的 AI 网络防御,并与行业合作建立 AI 网络安全信息交换中心。据 TechCrunch 报道,该行政令回应了行业反对意见,范围较此前讨论版本有所缩小。

White House · 2026-06-02 · TechCrunch 报道原文
#12政策与治理

Google Search 允许网站退出 AI Overviews

Google 在 Search Console 中测试新控件,允许网站所有者选择是否让网站内容出现在 AI Overviews、AI Mode 等生成式 AI 搜索功能中。 该功能应英国反垄断机构 CMA 要求推出,目前面向英国部分网站测试,后续将全球推广。退出后网站将不会从这些 AI 功能获得流量,但该设置不影响常规搜索排名。 同时 Google 披露,AI Overviews 月活用户已超 25 亿,AI Mode 月活超 10 亿。

Google Blog · 2026-06-03 · Bloomberg 报道原文
#13政策与治理

OpenAI 发布前沿 AI 治理蓝图

OpenAI 发布前沿 AI 美国治理蓝图,提议建立持久联邦安全框架。 蓝图涵盖在州级安全法律共识上构建国家框架、强化 CAISI 作为联邦前沿安全主要机构,以及动员应对国家安全挑战的韧性计划。CEO Sam Altman 前往华盛顿推动公私合作,计划与白宫官员及国会议员会面。 此举正值美国领导人呼吁 AI 公司自愿在发布前共享前沿模型供审查。 ---

#14安全与行业

Anthropic 报告:AI 攻击转向后入侵自主操作

Anthropic 发布报告,分析 2025 年 3 月至 2026 年 3 月间 832 个恶意账户。 报告指出,AI 攻击正从编写恶意软件转向后入侵操作,中高风险攻击者占比从前半年的 33% 升至后半年的 56%。攻击者利用 AI 进行横向移动、账户发现等复杂操作,传统风险评估方法已失效。 报告认为,MITRE ATT&CK 框架未涵盖 AI Agent 自主编排攻击链的行为,当前框架已不敷使用。Anthropic 已部署网络防护措施,正与 MITRE 探讨框架演进。

#15安全与行业

NeurIPS 被曝使用未校准 AI 检测器

NeurIPS 2026 Position Paper Track 在 desk rejection 流程中使用了未校准的 AI 文本检测器 Pangram,引发争议。 一位投稿者因被检测出高 AI 分数而被拒,但该检测器在会议主席论文上同样给出 24%-69% 的 AI 分数。NeurIPS 的验证测试基于非目标分布,实际提交池的"异常高标记率"表明存在分布偏移和误校准。 该事件暴露了学术会议使用 AI 检测工具时缺乏方法论严谨性。 ---