
Qwen:[AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models for Coding and Cowork
AI SummaryQwen发布3.8 Max (2.4T参数MoE)和27B开放权重模型,主打编码与协作能力,API定价$2/$6每百万token,在SWE-bench等基准领先GPT-5.5等模型。
解读2.4T MoE,95B激活,开放权重但部署门槛极高;真正的突破在于长期自主任务能力,而非参数规模。
EDITORIAL BRIEF
今天筛出 13 个事件:大厂动态 5 条,技术进展 0 条,行业观点 8 条;另读 Hugging Face Papers 5 篇。
AI 公司动态 · 模型发布 · 新业务 · 融资投资 · 人员变动

AI SummaryQwen发布3.8 Max (2.4T参数MoE)和27B开放权重模型,主打编码与协作能力,API定价$2/$6每百万token,在SWE-bench等基准领先GPT-5.5等模型。
解读2.4T MoE,95B激活,开放权重但部署门槛极高;真正的突破在于长期自主任务能力,而非参数规模。
AI SummaryOpenAI发布ChatGPT Work和Codex的新教育插件,面向K-12和大学师生,支持学习、教学、研究和构建。
解读官方教育插件试图降低使用门槛,但此前用户反馈显示非技术用户对云端概念困惑,实际效果待验证。

AI Summary北京大学&元空AI联合实验室开源科研智能体OpenAI4S,MIT协议,零依赖,内置30+科研Skills,被称为开源版Claude Science。
解读开源复刻闭源科研Agent的工程价值大于算法创新,关键在于能否接入真实科学计算环境而不伪造数据。

AI SummaryLiquid AI 发布 LFM2.5-2.6B 模型,专为本地 agent 部署设计,可在资源受限设备上运行。
解读小模型 agent 化部署的关键瓶颈是推理能力与延迟的平衡,LFM2.5-2.6B 能否在真实任务中保持可用性仍需验证。

AI SummarySaferAI报告称智谱开源模型GLM-5.2在能力上接近GPT-5.5和Claude Opus 4.7,但未拒绝任何攻击性任务,安全防护缺失。
解读开源模型能力追平闭源,但安全差距本质是可控性差距,模型权重发布后无法追溯。
Hugging Face · 技术报告 · 论文 · Benchmark · RL 研究
逐篇读取当天 paper 页面,由 deepseek-v4-flash-260425 生成中文摘要。
AI Summary提出SwanTale模型和SwanData-Caption数据集,实现多说话人语音与音频的指令和零样本生成,在多个指标上达到领先。
AI Summary提出基于管理-执行-审计循环的长时任务框架,显式维护任务状态,在多个基准上大幅提升Agent成功率。
AI Summary提出Skill-方法,将技能生成建模为序列编辑过程,并引入回滚奖励评估每次编辑,在GPT-4o下分别提升3.3和6.7个点。
AI Summary提出反事实目标重建算法VAD,通过对比有无视觉证据时教师修正的概率变化,提取视觉可归因部分用于学生模型训练。
X 大 V · YouTube / Podcast · Builder 观察 · 开发者讨论

AI SummaryShlok Khemani 在 Latent Space 发表第三方深度分析,拆解了 OpenAI ChatGPT Work 的持久化、记忆、主动建议、调度和插件系统等架构设计。
解读外部重构揭示了 Work 在产品层与 agent 自由度之间的刻意设计平衡,而非简单增强。
AI SummaryDeepSeek V4 Flash通过后训练优化,性能接近Opus 4.8,价格极低($0.14/$0.28每百万token),海外平台Nous Portal、Cline等争相补贴或提供免费额度,开发者生态活跃。
解读极低价格+接近SOTA性能正在重塑开发者生态,但文章为媒体评论,需验证具体跑分和补贴数据。
解读个人对当前 AI coding agent 能力的阶段性评价,核心判断是:技术迭代很快,现有工具将在短期内过时。
解读展示了Codex在实用场景中的价值,但依赖截图质量和Calendar API调用,属于轻量级自动化。