#01 模型与评测
Grok Voice Think Fast 2.0上线,语音首包延迟降至0.70秒 Grok Voice Think Fast 2.0已通过API与Voice Agent Builder上线,首个音频生成时间从1.25秒缩短到0.70秒。 SpaceXAI引用Artificial Analysis数据称,新版本的AA Speech-to-Speech Quality Index为82.9%,高于Think Fast 1.0的75.7%、GPT-Realtime-2.1 High的79.1%和Gemini 3.1 Flash High的69.5%。 厂商还称,在24种语言的短语转写测试中,新模型相对Deepgram Nova 3和ElevenLabs Scribe v2的错误率改善1.5至2.0倍,噪声环境中的差距约为10倍。这些转写数据来自SpaceXAI自测。服务按音频时长计费,每分钟0.08美元;grok-voice-latest将在8月5日切换到新版本。
#02 模型与评测
OpenAI称保留推理与上下文压缩让ARC-AGI-3得分翻近三倍 OpenAI在GPT-5.6 Sol上启用推理保留与上下文压缩后,ARC-AGI-3公共集的RHAE得分从13.3%升至38.3%,输出token减少6倍。 RHAE全称Relative Human Action Efficiency,OpenAI估算该公共集的人类测试者平均得分为48%。 官方harness会在每轮操作后丢弃私有推理,并在历史达到175000字符后滚动截断。OpenAI改用Responses API保留跨轮推理,再用compaction替代滚动截断,模型因而能持续记住先前策略。这组对照强调的是harness设置对评测结果的影响,并非模型权重发生变化。
#03 模型与评测
Google发布Lyria 3.5,接入Flow Music Google发布音乐生成模型Lyria 3.5,并已在Flow Music中开放。 官方称,新版能生成更丰富、复杂且自然的旋律结构,改善歌词质量、提示遵循、结构意识、人声情感与发音。 创作控制方面,Lyria 3.5可以更直接地控制节奏和输出时长。Google此次未公开模型参数、训练数据、定价或独立评测结果。
Google Blog · 2026-07-29 原文 #04 Agent安全与评估
Perplexity开源Numbat,在Agent执行前做本地检测与拦截 Perplexity以Apache-2.0许可证开源Agent安全工具Numbat,可从桌面、CLI、IDE和网关Agent的hook、插件、OTLP日志及本地会话产物中采集事件,并用CEL规则在端侧检测。 工具支持只读扫描、实时监控、可选的执行前拦截和事后取证,还能生成带SHA-256清单的案件包。 Perplexity称内部已用Numbat保护Claude Code、Codex、OpenCode和Pi。项目内置52条规则,分为11类,并能识别“读取密钥后外传”等多步序列;默认模式只监控,所有内置规则都不会直接阻断,管理员需显式启用执行前拦截。单一二进制支持macOS、Linux和Windows。 代码:https://github.com/perplexityai/numbat
Perplexity Research / GitHub · 2026-07-29 原文 #05 Agent安全与评估
Qoder开源Better Harness,审查AI编程工作流而非只看代码差异 Qoder以MIT许可证开源Better Harness,从任务理解、受控执行、变更验证、可靠交付和学习沉淀五个维度审查AI编程工作流。 它不只比较最终代码差异,还读取项目机制与可用的会话证据,生成包含证据、影响、修复边界和验收检查的报告;缺失证据会被明确标出,不会自动推定流程有效。 项目支持Claude Code、Codex Desktop与CLI、Qoder、Cursor和GitHub Copilot等入口。运行时要求Node.js 22.20.0以上、25以下;不同宿主的会话证据覆盖度并不完全相同,报告会保留这些边界。
QoderAI · GitHub · 2026-07-29 原文 #06 Agent安全与评估
NVIDIA给出可自托管的“受验证AI编程助手”方案 NVIDIA发布一套自托管代码助手教程,将模型放在执行层,把访问策略、依赖验证、代码追踪和监控留在模型之外。 示例用StarCoder2-7B NIM提供本地补全,由NeMo Guardrails拦截对“human-only”文件的请求;代码进入CI后再经过测试、SAST、密钥、许可证和虚构依赖检查。 每次提交会保留追踪标记,合并结果再进入Prometheus与Grafana,观察AI辅助变更的缺陷逃逸率。试验最低要求24GB显存、Python 3.10以上、Docker和NVIDIA Container Toolkit;H100、H200不是试验的硬性要求。
NVIDIA Technical Blog · 2026-07-29 原文 #07 推理与部署基础设施
腾讯开源AngelSpec,把六种推测解码草稿架构放进同一训练框架 腾讯开源AngelSpec,一个覆盖MTP和块并行推测解码的PyTorch原生草稿模型训练框架。 同一条训练管线可切换DFly、DFlash、DFlare、Eagle3、DSpark和MTP六种架构,并组合CE、top-k KL、LK、D-PACE等训练目标。 AngelSpec支持文档隔离的序列打包、最长128K上下文训练,以及在训练期间用真实推测解码在线统计平均接受长度。训练与推理使用独立GPU worker group,通过Mooncake传递隐藏状态;项目同步发布面向Hy3和Qwen3-8B的多组草稿模型。 论文:https://arxiv.org/abs/2607.25852
Tencent / AngelSpec · GitHub · 2026-07-29 原文 #08 推理与部署基础设施
MiniMax与Fireworks开源M3稀疏注意力Blackwell内核 MiniMax与Fireworks开源M3块稀疏注意力的NVIDIA Blackwell SM100 CuTe-DSL内核。 KV-outer方案会把被多个query选中的同一KV block只加载一次,减少选择重合时的KV cache读取;项目同时提供提前编译的C++后端和Python JIT回退路径。 内核支持BF16、FP16和FP8输入,head dimension固定为128,兼容64或128 token分页KV cache、变长批次、MHA/GQA/MQA,以及因果和非因果注意力。运行要求Blackwell SM100或更新GPU、CUDA 13;仓库采用Apache-2.0许可证,改编自FlashAttention-4的部分按BSD-3-Clause分发。
MiniMax / Fireworks AI · GitHub · 2026-07-29 原文 #09 推理与部署基础设施
NVIDIA ModelExpress把模型副本扩容从8分钟压到1分44秒 NVIDIA ModelExpress会先寻找集群内已有的兼容权重副本,优先通过NIXL进行GPU到GPU的P2P RDMA传输。 如果没有可复用副本,系统再从对象存储流式加载,或用GPUDirect Storage从本地存储直读GPU,避免每个新副本都重复经过对象存储、磁盘和主机内存。 NVIDIA给定环境的测试中,DeepSeek-V4 Pro权重与JIT kernel cache从现有服务副本传入新副本耗时不到10秒,模型总启动时间从8分钟降至1分44秒。ModelExpress还提供vLLM、SGLang、Dynamo和llm-d集成,并可用于分发强化学习阶段持续更新的权重。
NVIDIA Technical Blog · 2026-07-24 原文 #10 产品与科研
OpenAI将免费向十万名学术研究者提供前沿模型 OpenAI启动ChatGPT for Academic Researchers,先在今年夏季向1万名研究者开放,计划到2027年扩至10万人。 计划面向选定学术机构的科学、数学和工程研究者,启动时提供GPT-5.6 Sol Pro,并允许每位获批者邀请最多四名本机构协作者。 工作区默认不使用研究者数据训练模型,并提供更高额度、更大上下文、deep research、ChatGPT Work与Codex等能力。该计划属于OpenAI到2027年投入超过2.5亿美元支持外部科研的承诺;申请人需验证学术机构关系和实际研究用途。
#11 产品与科研
Gemini for macOS加入全局语音输入与屏幕上下文操作 Gemini for macOS加入全局语音输入,用户长按Fn键即可在桌面任意窗口中智能听写。 应用会过滤“嗯”“啊”等语气词、处理句中修正,并把整理后的文本直接插入当前光标位置。 用户在设置中启用Gemini reasoning后,应用还能结合屏幕上下文提取和总结本地文件、改写选中文本,以及生成或编辑图片。新功能正向全球macOS应用用户推出,目前只支持英语。
Google Blog · 2026-07-29 原文 #12 产品与科研
Replit Design把60万张真实界面参考接入AI设计流程 Replit Design面向所有用户上线,可选择Claude、GPT-5、Gemini、Kimi和GLM等模型完成设计。 产品内置Ambient Intelligence,在设计过程中持续建议变体和下一步;Mobbin界面库则提供来自1000多个应用的60万张以上真实屏幕作为参考。 用户可以从空白页、模板或多模板混合开始,也能上传或新建设计系统,让不同页面统一套用品牌规范。设计完成后可以继续在Replit中构建并直接发布应用或网站,原有Canvas项目也会进入Replit Design。 ---
Replit Blog · 2026-07-29 原文