
Warp:How Warp builds self-improving agents on Claude
AI SummaryWarp 在 Claude 平台上用 Agent Skills 构建自我改进 agent:内层技能执行任务,外层 improver 技能定期汇总人类反馈,提出对技能文件的小幅修改,经 PR 审查合并后持续优化 age。
解读本质是把人类反馈沉淀为可版本控制的技能文件,由 improver agent 定期改写 base skill,形成可审查的自我改进闭环。
EDITORIAL BRIEF
今天筛出 13 个事件:大厂动态 5 条,技术进展 2 条,行业观点 6 条;另读 Hugging Face Papers 5 篇。
AI 公司动态 · 模型发布 · 新业务 · 融资投资 · 人员变动

AI SummaryWarp 在 Claude 平台上用 Agent Skills 构建自我改进 agent:内层技能执行任务,外层 improver 技能定期汇总人类反馈,提出对技能文件的小幅修改,经 PR 审查合并后持续优化 age。
解读本质是把人类反馈沉淀为可版本控制的技能文件,由 improver agent 定期改写 base skill,形成可审查的自我改进闭环。
AI SummaryMiniMax 公告修订与阿里云的主 API 服务协议及云计算服务协议项下 2026-2028 年度持续关连交易上限,涉及向阿里提供 API 服务及采购云产品。
解读这是上市公司对关联交易额度的例行调整,反映 MiniMax 对阿里云资源采购和 API 业务规模的预期变化,本身不构成技术或产品进展。

AI SummaryAWS发布Bedrock AgentCore Evaluations,通过OpenTelemetry遥测统一评估不同agent框架,支持LangGraph、LlamaIndex、OpenAI Agents SDK等。
解读把评估从框架绑定中解耦,用OpenTelemetry作为通用语言,是agent工程化的务实一步。

AI SummaryZ.ai 确认是匿名开源模型 Ox Alpha 的幕后实验室,该模型在 OpenRouter 匿名发布并登顶基准测试,权重将于周三发布,是 GLM 系列最新迭代,定位编码与 agentic 工作负载。
解读匿名登顶再自曝,本质是智谱以开源推理模型向闭源前沿厂商发起正面冲击,营销与实力兼备。

AI SummaryGoogle发布Gemini 3.5 Transcribe语音转文字模型,支持85+语言、自动去除填充词、自定义词汇和多说话人识别,已通过Gemini API开放,并在macOS应用和Android Rambler上线。
解读本质是语音转录从“转文字”升级为“语音代理入口”,通过函数调用和屏幕上下文扩展能力;但3.5 Pro未发,说明Google在分模块推进。
Hugging Face · 技术报告 · 论文 · Benchmark · RL 研究
逐篇读取当天 paper 页面,由 deepseek-v4-flash-ga-260731 生成中文摘要。
AI Summary提出 OraRL,将注释作为 oracle rollout 引入视频多模态大模型的强化学习后训练,通过解耦优势估计器避免优势反转,提升采样效率与性能。
AI Summary该图对比了多个软件系统在精度与运行时间上的最佳权衡曲线,涉及Microsoft C++编译器、AutoSaddler、Meta-Harness和GEPAPI。

AI Summary量子位实测豆包工作:与飞书深度打通,可自动完成品牌物料制作、采购比选、群聊信息梳理等任务,并支持企业账号直接登录,强调企业上下文是Agent竞争分水岭。
解读办公Agent基础能力趋同后,真正的壁垒在于对企业上下文的理解和权限体系的原生集成。豆包工作借飞书生态抢跑,但终局未定。

AI Summary英伟达在Hot Chips 2026披露,Vera Rubin NVL72在DeepSeek V4-Pro Agent负载下每兆瓦吞吐较GB300最高提升30倍,但关键不在GPU,而是GPU、Groq LPX、CPU。
解读Agent推理的优化对象已从单颗GPU转向整条任务链,英伟达在重新划分GPU、LPX、CPU与网络的边界。
X 大 V · YouTube / Podcast · Builder 观察 · 开发者讨论
解读本地 Agent 权限越深,系统集成不稳的代价越大;Codex 锁定模式连钥匙串都能锁死,说明本地执行路径的工程成熟度还撑不起关键工作流。