#01 模型与多模态
PrismML 发布可在手机运行的 1-bit Bonsai 27B PrismML 7 月 14 日发布基于 Qwen3.6-27B 的 Bonsai 27B,其中 1-bit 版本体积 3.9GB,可装入 iPhone 17 Pro Max 的应用内存预算。 1-bit 版本真实位宽为 1.125 bit;Ternary 版本位宽 1.71 bit、体积 5.9GB,主要面向笔记本。两个版本均支持视觉输入、工具调用、262K 上下文和投机解码,采用 Apache 2.0 许可证。 官方在 15 项评测上给出总分:全精度基座为 85.0,Ternary 版为 80.5,1-bit 版为 76.1,分别保留约 95% 和 90% 的基线成绩。在 RTX 5090 上,两版最高生成速度分别为 134 和 163 token/s;在 M5 Max 上分别为 58 和 87 token/s。手机演示注明图像上下文采用缓存与预填充。 模型:https://huggingface.co/collections/prism-ml/bonsai-27b
#02 模型与多模态
阿里 ATH-MaaS 开源 0.8B 文档解析模型 OvisOCR2 阿里 ATH-MaaS 团队开源 OvisOCR2,一款基于 Qwen3.5-0.8B 后训练的端到端页面级文档解析模型。 模型把页面图像转换为按自然阅读顺序排列的 Markdown,覆盖文本、公式、表格和视觉区域;训练结合真实与合成数据,并使用多阶段 SFT、强化学习和 OPD。 官方称 OvisOCR2 在 OmniDocBench v1.6 得到 96.58 分,成为首个登顶该榜的端到端模型;在 PureDocBench 上,Avg3 得分为 75.06。模型采用 Apache 2.0 许可证,Hugging Face 已提供权重和 vLLM 推理示例。模型卡同时提醒,复杂文档仍可能出现错误或不完整输出。
#03 模型与多模态
OpenMOSS 开源 11B 实时视频模型 MOSS-VL-Realtime OpenMOSS 开源面向连续视频流理解的 MOSS-VL-Realtime,包含 11B 参数和 256K 上下文窗口。 模型把带绝对时间戳的视频帧、用户问题与回答编码为交错 token 流,支持在任意时刻提问、边感知边生成、证据不足时主动保持沉默,并根据新画面修正或中断先前回答。 架构采用解耦交叉注意力、绝对时间戳和 XRoPE,以处理时间敏感的视频流。官方称模型在多项流视频理解基准取得开源领先成绩;单个模型实例目前仅支持一个活跃实时会话。项目采用 Apache 2.0 许可证,并开放模型测试与研究使用。 模型:https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime
#04 模型与多模态
通义万相开源 14B 音乐转舞蹈模型 Wan-Dancer 通义万相开源 Wan-Dancer-14B,可根据一张人物图片和一段音乐生成长时舞蹈视频。 生成过程分为全局关键帧规划和局部时序细化两个阶段,使用完整音乐上下文维持长程结构、节奏同步与动作连续性。官方提供中国古典舞、街舞、K-Pop、拉丁舞和踢踏舞五类提示模板。 模型权重、推理代码和 ComfyUI 集成均已开放,Hugging Face 与 ModelScope 提供在线体验,项目采用 Apache 2.0 许可证。官方说明,长视频可在全局阶段使用更多扩散步数,随后再运行局部细化阶段生成高分辨率成片。 代码:https://github.com/Wan-Video/Wan-Dancer
#05 模型与多模态
腾讯混元发布 Hy3 的 1-bit 与 4-bit 量化版本 腾讯混元为 295B 总参数、21B 激活参数的 Hy3 发布 1-bit、4-bit 和 GPTQ Int4 量化版本。 原版 BF16 权重接近 600GB;发布方称 1-bit 版压至 85.5GiB,可在单张 96GB 显卡部署,4-bit 版为 169.9GiB,需要两张显卡,GPTQ Int4 则面向 vLLM 服务。 官方称 4-bit 版输出分布与原版基本一致,1-bit 版在长文理解上接近原版,但 Agent 与代码任务有小幅回落。团队同时发布 llama.cpp 的 MTP 补丁,称开启后 1-bit 和 4-bit 版本的解码速度分别提升约 50% 和 60%。 模型:https://huggingface.co/AngelSlim/Hy3-GGUF
#06 模型与多模态
Meta 未公开模型在亚洲物理奥赛理论考试获满分 Meta AI 称,公司将一款未公开模型提交参加 2026 年亚洲物理奥林匹克理论考试,取得 30/30 满分,与成绩最高的三名学生并列。 官方把这次参赛作为高级推理与多模态能力演示,并感谢竞赛委员会允许模型参加考试。 现有公告没有公开模型名称、参数规模、训练数据、作答过程、评分细则或完整解题报告,也没有说明模型与学生是否处于完全相同的答题条件。当前只能确认 Meta 官方公布了这一成绩,不能据此比较模型与人类参赛者的整体能力。 ---
Meta AI 官方 X · 2026-07-14 原文 #07 Agent 与产品
火山引擎发布 AI MediaKit CLI 与 Skill 火山引擎智能视频云发布 AI MediaKit CLI 与 Skill,把 100 多项音视频能力封装为 Agent 可调用的工具。 能力覆盖剪辑、字幕、画质增强、字幕擦除、转码、音频和图像处理;Skill 分为 editing、video、image、audio 四个能力域,可供 Claude Code、Trae、Cursor、Codex、OpenClaw 等调用。 异步任务的 taskid、状态查询、轮询与终态结果回收被下沉到工具层,本地剪辑与云端重算力处理也可以组合。官方提供 npx 安装入口,GitHub 仓库已公开。 代码:https://github.com/volcengine/mediakit-cli
#08 Agent 与产品
ChatGPT 上线跨聊天、项目、图片与文档搜索 OpenAI 7 月 14 日更新 ChatGPT,侧边栏搜索现在可以同时检索聊天记录、项目、图片和文档。 用户可用内容类型过滤器缩小范围,并直接打开对应的聊天、项目或文件。 该功能已在网页、iOS 和 Android 上线,面向全球所有 ChatGPT 方案。官方更新日志没有列出企业空间的额外管理开关或索引范围差异。
OpenAI Help Center · 2026-07-14 原文 #09 Agent 与产品
Perplexity 开源 WANDR 研究 Agent 基准 Perplexity 开源 WANDR(Wide ANd Deep Research)基准,包含 500 项源自真实生产请求的研究任务。 每项任务都要求 Agent 广泛发现符合条件的对象,并为每条结果提供具体证据,同时考察搜索覆盖和证据提取。 官方评估六个生产系统,Perplexity Search as Code 的软 F1 为 0.363、硬 F1 为 0.133,Anthropic 系统排名第二。发布方认为主要瓶颈在发现阶段覆盖不足。任务、评估工具和技术报告已开放,分数均为 Perplexity 的评测结果。 代码:https://github.com/perplexityai/wandr ---
Perplexity Research · 2026-07-14 原文 #10 资本与产业
PixVerse C 轮累计融资 4.39 亿美元并推出游戏引擎 PixVerse 7 月 14 日宣布完成 C 轮延展轮,使 C 轮累计融资额达到 4.39 亿美元,新投资方包括阿里巴巴、蓝色光标等。 公司同时推出 PixVerse Game Engine,把实时世界模型 R1 用于互动游戏:创作者定义规则和结构,引擎把它表达为持续生成、随自然语言输入实时响应的世界。 公司称,PixVerse 平台覆盖 177 多个国家和地区,用户超过 1.5 亿。PixVerse 还计划把实时世界模型用于互动直播,让 AI 角色根据观众输入实时响应。融资额、用户数和覆盖范围均来自公司公告。
#11 资本与产业
媒体称 DeepSeek 筹备 IPO 并商谈新融资 路透援引金融时报和彭博报道称,DeepSeek 在完成首轮约 70 亿美元融资后,开始与潜在新投资者接触,新一轮投前估值约 710 亿美元。 报道称,DeepSeek 5 月底完成首轮融资,投后估值约 520 亿美元;公司此后开始初步商谈新融资。 报道还称,DeepSeek 已启动 IPO 准备,最早可能今年提交上市申请。DeepSeek 未回应路透的置评请求,融资规模、估值和 IPO 时间均可能变化。 ---