返回日报索引

AI DAILY / 2026-07-05

07·05 - AI 午报:Claude API 调整,Codex 推理异常

今天的主线从本地推理转回开发者平台的可靠性问题:Anthropic 上调 Claude API 速率限制并简化层级,但同一批材料里也出现 Claude Code 疑似跨会话缓存泄漏、Codex 中 GPT-5.5 推理 token 异常聚类等开发工具事故线索。Agent 工程化方面,社区提出用“Applications”把模型放进更小、更可控的工作界面,MiMo-V2.5 的推理循环反馈则说明长推理模型仍需要外部决策约束。行业侧,Anthropic 启动自主药物研发,Midjourney 在版权诉讼中反向要求好莱坞片厂披露内部 AI 使用。

8 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01开发工具

Anthropic 上调 Claude API 速率限制,并取消按 API 使用量分层

Anthropic 官方宣布已为所有用户提高 Claude 平台 API 的速率限制,同时简化层级结构,新的层级不再基于 API 使用量分级。 最新 Sonnet 和 Haiku 模型在最高层级提供 5 倍更高的速率限制;各层级在 Opus、Sonnet、Haiku 模型上提供相同的每分钟请求数和令牌吞吐量,用户可按任务选择模型,而不是为了速率限制被迫切换模型。 层级提升会自动进行,用户也可在 Claude 控制台手动申请。对依赖 Claude API 的开发者来说,这次变化的直接影响是调用上限更清晰,模型选择和额度管理之间的绑定更弱。

#02开发工具

Claude Code 出现疑似跨会话缓存泄漏,Agent 输出无关上下文

GitHub Issue #74066 报告称,Claude Code 在一次会话中突然输出 Minecraft、墙面尺寸等与当前任务无关的内容,被用户怀疑存在跨会话缓存泄漏。 报告涉及 Sonnet 5 模型,首次响应等待超过 5 分钟后出现异常。发起者 milesrichardson-edb 表示,本地排查未找到对应文本,移动端响应也包含相同的无关内容。 社区讨论尚未形成定论:一部分评论认为这可能是模型幻觉,另一部分分析指向上下文隔离缺陷或多租户缓存问题。Anthropic 过去曾把类似现象解释为内部上下文错误呈现,但截至本稿,没有看到官方对这条 issue 的公开确认。 参考资料:https://news.ycombinator.com/item?id=48785665

GitHub Issues · 2026-07-04;Hacker News · 2026-07-04原文
#03开发工具

GPT-5.5 在 Codex 中推理 token 异常聚类,复杂任务准确率下降

多位开发者在 GitHub Issue 和 X 平台报告,GPT-5.5 在 Codex 环境中的推理输出 token 呈现反常固定值聚类,主要集中在 516,以及 1034、1552 等以 518 为步长的数值。 聚合数据显示,GPT-5.5 精确 516 事件占比达到 44%,明显高于其他模型;该比例在 5 月至 6 月间快速上升,同期平均推理 token 强度下降。 报告者把这一现象与复杂任务错误率增加联系在一起,但 OpenAI 尚未公开说明原因。社区临时规避方式包括修改系统提示配置、使用特定工具,或在提示前端加入更高强度的推理指令;这些方法仍属于经验性修补,不能替代平台侧解释。 参考资料:https://x.com/bdsqlsz/status/2073442704852226479 ---

GitHub Issues · 2026-07-04;X @bdsqlsz · 2026-07-04原文
#04Agent 与工程化

开发者提出“Applications”架构,用有限作用域应用降低 Agent 复杂度

一位开发者提出名为“Applications”的 Agent 架构:为模型创建有限作用域、持久状态的专用应用,例如文本浏览器和电脑控制界面,从而减少模型一次需要管理的工具和上下文。 作者把工具数量从 23 个大幅精简,让模型进入应用后只面对少量工具和局部状态,离开应用时再恢复完整上下文。 帖子称,该方法让小模型在复杂任务上的表现更稳定,尤其是精确文本处理和界面操作。作者在 RX6600XT 显卡上使用 Gemma 4 E4B,推理速度约 70-85 tokens/s。该方案仍是社区实验,但它把 Agent 失败问题从“换更大模型”转向“缩小模型当下要理解的世界”。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1unobl4/usingapplicationstomakeasmallermodelmore

Reddit r/LocalLLaMA · 2026-07-05
#05Agent 与工程化

MiMo-V2.5 在 opencode 场景出现推理循环,需要人工干预决策

Reddit 用户报告,MiMo-V2.5 在 opencode 工具场景中出现推理循环:模型能持续生成看似合理的推理文本,但无法停止并做出执行决策。 用户使用的是 unsloth 的 ud-q4kxl 量化版本,需要通过人工提示把模型从循环中拉出来。 同一用户也给出对照:在相同工具集下,MiMo-V2.5 的实际调研表现优于 Qwen 3.5 397B。Qwen 因缺少网页搜索、只依赖 web fetch 而产生严重幻觉;MiMo 则能审查并推翻原计划,通过 web fetch 完成实际调查。这条反馈显示,长推理并不等于可执行性,工具 Agent 仍需要明确的停止条件和决策约束。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1unfyfo/istheresomekdlchartformimov25orsomething ---

Reddit r/LocalLLaMA · 2026-07-04
#06本地推理与多模态

Blackwell GPU 30 路并发运行 Qwen3.6-35B-A3B NVFP4 多模态推理

Reddit 用户 Freonr2 在 RTX Pro 6000 Blackwell GPU 上使用 vLLM 部署 NVIDIA 的 Qwen3.6-35B-A3B-NVFP4 模型,实现 30 路并发图像批量标注。 该模型采用 MoE 架构和 NVFP4 量化,实测聚合吞吐量约 2000 tokens/s,其中提示吞吐约 1301 tokens/s,生成吞吐约 1924 tokens/s。 测试中 GPU KV 缓存占用仅 4.8%,多模态缓存命中率 50.1%,模型显存占用约 23.4GB,低于 Unsloth 版本的约 26GB。作者用蒙特卡洛模拟估计,在 c=24 并发时约 53% 的专家被激活,解释了 MoE 模型在多路并发下仍能保持较高吞吐的原因。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1unqkjy/concurrencyplusnvfp4onblackwell ---

Reddit r/LocalLLaMA · 2026-07-05
#07行业动态

Anthropic 启动自主药物研发,聚焦被忽视疾病

Anthropic 本月初宣布启动自主药物研发项目,重点针对传统药企因商业回报有限而长期缺乏投入的“被忽视疾病”。 项目聚焦新药研发早期阶段和临床前研究,Anthropic 尚未公布首批具体疾病,也没有说明未来候选药物会自主推进还是与外部机构合作。 多位业内专家提醒,AI 可以参与靶点发现、分子筛选和早期实验设计,但候选药物的毒性、安全性、药效以及人体临床试验验证,仍然很难被算法明显压缩。也就是说,这更像是 Anthropic 对 AI for science 的长期下注,而不是短期药品发布。

#08行业动态

Midjourney 要求好莱坞片厂披露内部 AI 使用

据 TechCrunch 报道,Midjourney 在与 Disney、Universal 及 Warner Bros. 的版权诉讼中提交动议,要求法官强制三家制片厂披露其所有内部 AI 使用方式。 此前法官裁定制片厂只需提供与“面向消费者”内容相关的生成式 AI 信息,Midjourney 认为这一范围过窄。 Midjourney 的理由是,制片厂可能在内部开发同类图像生成 AI,甚至同样利用未授权版权内容训练。该公司还要求对方提供在平台上使用过的所有提示词与生成结果;制片厂首席律师则把这一要求称为“钓鱼取证”。这起诉讼已经从“模型是否训练了版权内容”扩展到“原告自身如何使用 AI”的证据攻防。 ---