
阿里(阿里巴巴):阿里Qwen3.8正式发布:2.4T规模,自主编程16天搓出一个Hermes Agent
AI Summary阿里发布Qwen3.8,2.4万亿参数MoE模型,编程和Agent能力大幅提升,自称16天自主编程生成Hermes Agent级别的框架,API已上线,千问办公公测。
解读Qwen3.8是阿里在MoE架构和Agent能力上的重要产品更新,但自主编程16天案例需独立复现验证。
EDITORIAL BRIEF
今天筛出 15 个事件:大厂动态 5 条,技术进展 1 条,行业观点 9 条;另读 Hugging Face Papers 5 篇。
AI 公司动态 · 模型发布 · 新业务 · 融资投资 · 人员变动

AI Summary阿里发布Qwen3.8,2.4万亿参数MoE模型,编程和Agent能力大幅提升,自称16天自主编程生成Hermes Agent级别的框架,API已上线,千问办公公测。
解读Qwen3.8是阿里在MoE架构和Agent能力上的重要产品更新,但自主编程16天案例需独立复现验证。

AI SummaryGoogle DeepMind 使用基于 Gemini 的 AI 代理在 60 天内发现并修复了 1072 个 Chrome 安全漏洞,包括一个存在 13 年的沙箱逃逸漏洞。
解读AI 代理在漏洞发现和修复上的效率远超人工,但暴露出安全修复节奏与用户更新意愿之间的新矛盾。

AI Summary阿里巴巴正式发布Qwen3.8,总参数量2.4T,激活95B,编程和办公能力大幅提升,API已上线,Max版下周开源,同时开源27B。
解读Qwen3.8在编程长周期任务上展示了自主闭环能力,但核心突破在于MoE与混合注意力联合优化带来的推理效率提升及真武超节点适配。

AI Summary阿里旗下“千问办公”(QwenWork) 开启公测,整合三款产品,支持桌面端/云端/企业协同 Agent,并已打通钉钉,提供 Qwen3.8 模型体验。
解读阿里将多个 Agent 工具整合为统一办公平台,核心是打通企业工作流——这是从模型竞争力转向工程化部署的关键一步。

AI SummaryF1与AWS合作,使用Amazon Bedrock AgentCore构建Data Accelerator,将数据源接入时间从8周缩短至40分钟,并实现自动schema演化与端到端可观测性。
解读Agentic AI在工程自动化中落地可行,但价值取决于数据管道标准化程度和BRD质量,不能简单复制到所有场景。
Hugging Face · 技术报告 · 论文 · Benchmark · RL 研究
逐篇读取当天 paper 页面,由 deepseek-v4-flash-260425 生成中文摘要。
AI Summary提出RLSVR框架,通过任务转换将开放任务转为可验证代理环境,实现自验证奖励的LLM自改进。
AI Summary提出首个大规模触觉数据预训练的VTLA基础模型,在精细操作和离线策略改进上显著超越基线。
AI Summary提出AISPA框架,从八个维度审计88个商业AI产品的系统提示,发现保护性指令广泛但深度不足,约40%产品存在不利于用户的指令。

AI SummaryAnthropic 详细介绍了 Claude 在 Web、Code 和 Cowork 产品中的安全隔离架构,强调通过文件系统、网络和执行环境建立确定性安全边界,并披露了多个安全事件和设计调整。
解读安全不能依赖用户确认或模型识别意图,运行环境本身才是最后防线。
X 大 V · YouTube / Podcast · Builder 观察 · 开发者讨论
AI Summary国会支出记录显示,OpenAI 的 ChatGPT 占国会 AI 工具支出的 90%,主要用于起草备忘录、总结立法等。
解读政策场景的采用并不代表技术壁垒,10 万美元的支出说明还未形成大规模采购。

AI SummaryMiniMax发布H3开源多模态模型,但文章重点分析其面临Kimi K3性能与DeepSeek价格的双重挤压,以及财务亏损、股东减持压力。
解读MiniMax开源H3是行业竞争下的被动跟随,财务压力与股东耐心是核心风险。
AI SummarySimon Willison 评论认为,LLM(如 Claude)极大降低了阅读和修改开源代码的摩擦,使开源自由从理论变为实际可行,他每天多次用 Claude Chat 克隆并分析代码。
解读本质是 LLM 降低了开源参与的门槛,真正意义在于从“让别人做”变为“自己快速理解”,是 AI 辅助编程的实践案例。
AI SummaryInfoQ 视频介绍如何使用 DeepSeek-TUI+ 工具进行 Vibe Coding 编程实践,属于技术演示与经验分享。
解读展示 DeepSeek 在终端交互式编程工具上的探索,非模型能力突破,更偏工程实践。

AI SummaryOpenAI内部模型Astra被用于解决10个重大数学开放问题,并生成Lean证明。该消息引发关于模型能力是否本质提升的讨论。
解读数学推理能力确实有突破,但部分问题Fable也能解决,说明能力提升可能更多来自工程优化而非架构飞跃。
解读Codex CUA已能在真实客服场景中完成端到端自主操作和举证,展示Agent在复杂交互中的执行力。