返回日报索引

AI DAILY / 2026-06-01

06·01 - AI 午报:MiniMax M3 开源三合一、OpenAI 成立机器人团队、Qwen-VLA 适配多形态机器人

MiniMax 今天发布并上线了 M3 开源模型,首次把编码、智能体和 1M 长上下文压进同一个权重包,SWE-Bench Pro 跑到 59.0%,MCP Atlas 74.2%,但社区发现计费方案已悄然从按次制改为积分制。OpenAI 宣布成立 OpenAI Robotics,由 Aditya Ramesh 领导,短期做基建场景机器人,长期目标是通用个人机器人;同一天 Qwen 发布 VLA 模型,用一套权重适配多种机器人平台。基准测试方面,新出的 DeepSWE 把闭源和开源模型的差距拉到了两位数百分比,GPT-5.5 跑分第一但幻觉率高达 86%。

15 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与编码能力

MiniMax M3 开源发布:编码、智能体、1M 长上下文三合一

MiniMax 发布 M3 开源模型,在单一权重中融合编码、智能体与长上下文三项能力。在编码和智能体基准测试中,M3 的 SWE-Bench Pro 达到 59.0%,Terminal Bench 2.1 为 66.0%,SWE-fficiency 34.8%,KernelBench Hard 28.8%,MCP Atlas 74.2%。模型采用 MiniMax Sparse Attention 技术,将上下文窗口扩展到 1M token。M3 权重已开源,API 同步上线,并在 OpenCode 中提供限时免费使用。

#02模型与编码能力

MiniMax M3 上线 API,支持原生多模态与 1M 上下文,计费方案引争议

MiniMax 于 6 月 1 日通过 API 和 Token Plan 开放 M3 模型使用。该模型支持原生多模态输入,针对 Agent 推理、工具调用、代码和长文档等场景优化。计费方面,输入 512k tokens 以内享 7 天五折优惠,折后输入 2.10 元、输出 8.40 元每百万 tokens。超过 512k 的长文本能力目前限时限量供应,官方预计数日后全量开放。不过社区发现,原有的按次计费已被悄然替换为积分制,此前套餐中的调用次数优势消失,部分用户在 Linux Do 上发帖表达不满。与 DeepSeek v4 Pro 对比,M3 推理速度明显较慢,但任务完成质量接近 Pro 水平。

MiniMax 官方 · 2026-06-01 · 原文:`https://www.minimaxi.com/news/minimax-m3-zh`
#03模型与编码能力

OpenAI Codex 用户突破 500 万,付费用户额度全部重置

OpenAI Codex 负责人 Tibo 宣布,Codex 用户数已突破 500 万。为庆祝这一里程碑,北京时间 5 月 31 日晚约 11 点半,官方将所有 ChatGPT 付费订阅用户的 Codex 使用额度清零重置,每周和每小时限额均恢复至 100%。 编者注:编者没注意到会重置的提示,遗憾错过了猛蹬的机会 😭 ---

#04机器人与具身智能

OpenAI 成立 OpenAI Robotics,Aditya Ramesh 领导

Sam Altman 宣布,OpenAI 世界模拟研究项目已演变为 OpenAI Robotics,正式启动招聘。团队由 Aditya Ramesh 领导,以机器人硬件和 ML 研究的协同设计为基础。短期内聚焦开发支持熟练工人建设基础设施的机器人,长期愿景是让每个人都拥有能执行任何任务的个人机器人。团队正在招募全栈硬件、运维、系统和 ML 工程师。Greg Brockman 也在 X 上确认团队取得快速进展。

X @sama · 2026-06-01 · 原文:`https://x.com/sama/status/2061117302528188712`
#05机器人与具身智能

Qwen-VLA 统一视觉-语言-动作建模,一套权重适配多平台

Qwen 团队发布 Qwen-VLA 视觉-语言-动作通用模型,基于 Qwen3.5-4B 骨干网络与 1.15B DiT 动作解码器构建。模型通过统一的动作与轨迹预测框架,实现对机器人操作、视觉语言导航和轨迹预测的联合处理。四阶段渐进式训练与形态感知提示词条件机制使单套权重无需平台专属输出头即可适配多种机器人平台。在 LIBERO、Simpler-WidowX、真实 ALOHA 双臂机器人等评测中,Qwen-VLA-Instruct 匹配或超越专项微调专家模型。 ---

#06开源工具与基础设施

NVIDIA Parakeet 语音识别移植到 ggml,GPU 推理提速 5 倍

开发者将 NVIDIA Parakeet 语音识别模型移植到纯 C++/ggml 引擎,输出与 NeMo 框架字节级一致,GPU 推理速度提升最高约 5 倍,内存减少约 2 倍。项目支持 FastConformer TDT/CTC/RNNT/hybrid 模型,提供 GGUF 量化版本(f16/q80/q6k/q5k/q4k),在 GPU 上实现约 600 倍实时速度。移植后无需 Python 和 PyTorch,可在 CPU 和 GPU(CUDA/HIP/Vulkan/Metal)上运行,支持缓存感知流式传输和词级时间戳。项目同时集成到 LocalAI 作为后端,提供 OpenAI 兼容的 /v1/audio/transcriptions 本地端点。

Reddit r/LocalLLaMA · 2026-05-31原文
#07开源工具与基础设施

OpenClaw 推出 auto 模式,LLM 自动审批主机命令

OpenClaw 公开测试 auto 审批模式,在 YOLO 免审与 Ask 人工审批之间提供折中方案。命令匹配允许列表时直接放行,未匹配时由独立 LLM 审查器分析,仅允许一次低风险执行,高风险或模糊情况退回人工。用户通过 tools.exec.mode: auto 启用,审批请求可推送至 Slack、Telegram 等渠道。审查器模型可与主代理分离,例如使用 openai/gpt-5.5 进行判断。auto 模式严格遵守主机本地安全设置,未来可能成为默认选项。

#08开源工具与基础设施

Grok Imagine Video 1.5 上线 API,720p 排行第一

xAI 发布视频生成模型 Grok-Imagine-Video-1.5-Preview,通过 API 向开发者开放。模型支持文本和图像输入,提供 480p 和 720p 两种分辨率,按生成秒数计费:480p 每秒 0.08 美元,720p 每秒 0.14 美元。据 Arena.ai 平台数据,720p 版本在 Image-to-Video Arena 排行榜位居第一,相比前代同分辨率版本分数提升 52 分,超越 Seedance-2.0。模型在 us-east-1 和 eu-west-1 区域可用,速率限制每分钟 60 次请求。

#09开源工具与基础设施

英特尔联合魔搭社区上线 AI PC 专区,集成 OpenVINO 与智能体部署指南

英特尔联合魔搭社区上线"英特尔 AI PC 专区",集成针对酷睿 Ultra 优化的模型库、智能体部署指南及异构计算工具。专区包含 OpenVINO Model Center,提供已针对 CPU、GPU 和 NPU 转换量化的热门模型;设有 Claw 智能体板块,提供 OpenClaw、TRAE 及樱桃 AI 语音助手等框架的部署指南与技能集合。 ---

#10编码基准与模型评估

DeepSWE 基准测试出炉,闭源与开源模型编码能力差距拉大

新发布的 DeepSWE 编码基准测试显示,闭源模型与开源模型之间存在显著性能差距,此前在其他基准上仅几个百分点的差距在 DeepSWE 上被拉大到两位数。社区用户对开源模型当前表现感到失望,但期待其逐步追赶。值得注意的是,DeepSWE 的标价按单个任务而非整次运行计费——Mimo V2.5 Pro 标价 1.99 美元,但完整运行 113 个任务实际需约 225 美元;GPT 5.5 medium 完整运行约 264 美元。

Reddit r/singularity · 2026-05-31原文
#11编码基准与模型评估

GPT-5.5 DeepSWE 跑分第一,但幻觉率高达 86%

GPT-5.5 在 DeepSWE 编码基准测试中表现最佳,但 AA-Omniscience 报告其幻觉率高达 86%,远高于 Claude Opus 4.7 的 36%。这一矛盾引发社区讨论:高幻觉率与强指令遵循能力是否并存?有分析指出 Claude Opus 可能利用了基准测试的漏洞。与此同时,在 MineBench 测试中,Claude Opus 4.8 相比 4.7 在成本和推理时间上均有改善,平均推理时间 24.8 分钟,15 次构建总成本 41.52 美元。 ---

Reddit r/singularity · 2026-05-31原文
#12前沿研究与产品动态

脑细胞学会玩《毁灭战士》,CL1 生物芯片功耗仅 20 瓦

澳大利亚 Cortical Labs 公司利用 CL1 生物芯片,将约 20 万个实验室培养的人类脑细胞训练成能玩《毁灭战士》的"生物计算机"。这些细胞源自献血干细胞,此前已掌握《乒乓球》游戏。研究团队将游戏数字环境转换为电信号模式,神经元通过不同活动模式控制开枪、移动等操作。CL1 芯片功耗仅约 20 瓦,远低于传统硅基 AI 系统,可编程用于药物筛选和机器学习等任务。

Linux Do · 2026-06-01 · 原文:`https://linux.do/t/topic/2282194`
#13前沿研究与产品动态

Qoder 推出 Qwen3.7-Max 每日 200 次免费调用

阿里旗下 Qoder 于 6 月 1 日起向所有用户提供旗舰模型 Qwen3.7-Max 每日 200 次免费调用。活动覆盖 Qoder Desktop、JetBrains 插件、CLI、QoderWork 等全线产品,每日零点重置。社区有用户反映该模型性能已超过 GPT-5.5,但官方尚未公布基准数据。超出免费额度后仍享半价优惠,活动结束时间未公布。 ---

#14政策与行业动态

G7 就开源 AI 与开放权重 AI 术语达成共识

G7 国家就开源 AI 和开放权重 AI 达成共识,定义了共享术语。这是主要经济体首次在政策层面统一对开源 AI 的理解,有助于减少监管碎片化,为全球开源 AI 发展提供更清晰的框架。消息源自 Phoronix 报道,具体协议细节尚未公开。

Reddit r/LocalLLaMA · 2026-05-31原文
#15政策与行业动态

xAI 招聘中文 AI Tutor,加速 Grok 多语言语音能力

xAI 发布"AI Tutor - Chinese"远程岗位,招募中文母语者参与 Grok 模型的多语言音频数据标注与录制,以提升其语音交互、口音适应及跨文化理解能力。该职位支持全球远程办公,时薪 35 至 45 美元(美国地区),可全职、兼职或按合同工作。应聘者需中文母语、英语 B2 以上,并具备高精度跨口音转录能力。 ---