
智谱:刚刚,GLM-5.3发布:Coding更接近Fable 5!潜伏40年的bug都被揪出来了
AI Summary智谱发布开源模型 GLM-5.3,主打 Coding 与安全。官方称编程能力接近 Claude Fable 5,白盒代码审查得分 84.5% 成最强开源安全模型;量子位实测其能完成指环王基准、可交付游戏及漏洞修复等任务。
解读Coding 与安全被整合为同一工程能力:模型不仅要会写代码,还要能发现漏洞、修复并验证边界。
EDITORIAL BRIEF
今天筛出 13 个事件:大厂动态 5 条,技术进展 0 条,行业观点 8 条;另读 Hugging Face Papers 5 篇。
AI 公司动态 · 模型发布 · 新业务 · 融资投资 · 人员变动

AI Summary智谱发布开源模型 GLM-5.3,主打 Coding 与安全。官方称编程能力接近 Claude Fable 5,白盒代码审查得分 84.5% 成最强开源安全模型;量子位实测其能完成指环王基准、可交付游戏及漏洞修复等任务。
解读Coding 与安全被整合为同一工程能力:模型不仅要会写代码,还要能发现漏洞、修复并验证边界。

AI Summary阿里千问开源Qwen3.8系列,其中27B原生多模态稠密模型超越Qwen3.7-Plus,采用Apache2.0协议,量化后消费级显卡可运行;累计开源460余个模型,全球下载超30亿次。
解读用27B小参数多模态模型打本地部署市场,以开源数量和下载量巩固生态位,本质是开源生态的规模竞争。

AI SummaryAnthropic官方博客介绍如何高效使用Claude Code,通过/clear、@-mention、/compact等技巧减少token消耗和成本,并解释提示缓存机制。
解读官方教你省token:核心是管理上下文长度和提示缓存,技巧虽小但直接影响成本。

AI SummaryDeepSeek发布Harness v0.1并MIT开源,以Cordis插件系统实现模型、工具、Agent Loop等全插件化,提供四种运行模式,内置多Agent编排与统一事件流日志。
解读本质是把Harness做成可组装运行时,架构开放但编排范式无突破;价值取决于默认插件质量和生态,而非插件化本身。

AI Summary极客公园实测DeepSeek首个Agent产品Harness:开源框架、一切皆插件,发布12小时GitHub破5万星,作者用它重构网站并绘制涨星曲线,成本不足3元,同时指出其仍属开发者预览版,存在争议。
解读模型公司下场做Agent壳,DeepSeek选择全开源、一切皆插件,赌开发者生态。Harness层决定token消耗与数据归属,是比模型更深的护城河。
Hugging Face · 技术报告 · 论文 · Benchmark · RL 研究
逐篇读取当天 paper 页面,由 deepseek-v4-flash-ga-260731 生成中文摘要。
AI Summary提出将LLM路由统一为序列决策过程,构建xRouteBench基准和开源基础设施LLMRouter,支持16种以上路由器实现。
AI Summary提出动作条件视频世界模型,根据观测帧、语言指令和动作序列预测未来观测,并通过几何编码和深度分支增强一致性。
AI Summary提出在冻结基础模型下,通过自然选择进化Agent的提示、工具、记忆和控制流等harness组件,无需人工挑选即可提升性能。
AI Summary该条目仅包含一个图片文件名,摘要内容为“这是关于一个实习生的图片”,无法确认具体技术内容。
X 大 V · YouTube / Podcast · Builder 观察 · 开发者讨论
AI SummaryOpenAI Codex 负责人 Tibo 公开教用户将 GPT-5.6 Sol 接入 Claude Code 运行,开发者照做后 Anthropic 账号被封,Claude Code 负责人 Boris 澄清并挖人。
解读模型与 Harness 正在解耦,Coding Agent 竞争从模型能力转向执行环境。

AI SummaryNathan Lambert评GLM-5.3发布:智谱通过扩展后训练而非蒸馏达到前沿,750B参数在编码基准上超越Kimi K3,并分析中国实验室靠快速发布周期和RL数据产业保持竞争力。
解读文章核心观点:中国实验室靠后训练工程和快速发布周期追平前沿,蒸馏不是主因;GLM-5.3分数真实但模型更窄,纯文本无视觉。
解读一条个人体验帖,非官方发布;说明ChatGPT已能直接操作Google办公套件,但功能细节和覆盖范围仍需官方确认。
解读命名撞车是表层,背后是AI开发工具在定位和功能上的趋同;当所有产品都叫Studio,说明行业在'开发者工作台'品类上内卷。