开源 AI 桌面客户端 Cherry Studio 于 8/28 发布 v2.0.10。本版把 Mini Apps 从内嵌网页升级为带隔离沙箱的本地应用(可授权存储、文件、AI、通知、网络能力,支持安装、回滚与卸载),Agent 与 MCP 工具调用被拒绝时可填写理由并保留在历史中,出错诊断报告改为用户审阅后可选直传官方并回显报告 ID。此外新增并行 Web 搜索、Markdown 内渲染 ECharts 图表、模型 token 上限快捷预设,并收紧了模型生成内容的 HTML 预览沙箱(默认不跑脚本、交互产物走加固 webview)。这是 Cherry Studio 一周内的连续迭代,延续了把配置与能力从发版里解耦的节奏。
最新
Cline 的独立桌面客户端发布 v0.0.20,首次把 Cline Desktop 带到 Windows:提供代码签名的 x64 安装包,后台下载更新、重启即装;后台进程不再弹出可见控制台窗口。同步带来工具返回图片的内联渲染与轮播、覆盖全量索引历史的会话搜索、GitHub 集成引导,以及修复定时任务在更新后消失等问题。
Nous Research 的 Hermes Agent 发布 v0.20.6 稳定版,把自 v0.20.5 以来的约 525 个合并 PR、1313 次提交汇成稳定包。重点包括:consent-gated 真实浏览器画像浏览(Windows 端关窗需审批)、桌面浏览器独立 OS 窗口与受管 SSH 远程更新、远程 MCP 目录扩到 50+ 家现场验证的厂商服务(Cloudflare、Grafana Cloud、Better Stack、Railway 等)、web_search/web_extract 的 TTL 结果缓存,以及可选 OS 钥匙串加密存储密钥。
Y Combinator Spring 2025 批次的 iMessage 个人助理 Orchid,7 月 28 日发了一条病毒广告:AI 在男友忘掉纪念日时帮他订餐厅、送花并实时汇报进度,24 小时内冲到 320 万+ 播放、600+ 回复,却招来「外包人类情感劳动」的强烈反弹——「Tech people need to stop」「用来维持一段双方都暗自厌恶的关系的 AI」。产品本身不争议:跑在 iMessage 里,做邮件草稿、会议预订、晨间简报、差事;争议集中在广告把亲密关系任务自动化、以及共享 agent 的隐私边界(双方连到同一个助手时,谁看到什么、AI 自行决定回传什么)。这条反向病毒式传播成了 AI 营销如何踩中人际关系红线的最新案例,也折射出公众对 AI 侵入亲密领域的真实焦虑。
智谱 AI 编程产品 ZCode 8 月 11 日宣布全面升级,上线 Goal、Subagents、Remote Control、闲时任务四项功能,推动 Coding Agent 从对话辅助走向复杂任务自主交付;同日披露用户数已突破 100 万。ZCode 是面向 GLM 深度优化的国产 Coding Harness,智谱自研 Z.ai Code Bench 显示 GLM-5.2 搭配 ZCode 的任务整体通过率较搭配 Claude Code 高 2.39%,优势集中在跨文件、跨环节协作并完成最终验收的复杂任务;缓存命中率优化还将 GLM Coding Plan 有效额度提升约 30%,叠加 8 月 31 日前 1.5 倍额度活动,整体使用量接近翻倍。这是国产 Coding Harness 第一次在百万用户量级上验证「基础模型 + Harness + 订阅」的编程生态闭环。
发生了什么:Cline 于 8/26 发布 v4.1.16(CHANGELOG 标注 prepare 4.1.16),关键改动是 Windows CLI 二进制改用 Azure Trusted Signing 签名,降低被杀软误拦的概率;同时把 app 上下文(app-context)显式暴露出来,并随版发布 SDK v0.0.77(修复跨 CRLF 行尾的 patch 应用、桌面端 DMG 安装窗口定制等)。为什么重要:从“开源插件”走向“可被企业 IT 信任的二进制”是 Cline 上生产的前提,签名与上下文暴露这类看似底层的改动,恰恰决定了它能不能进公司机器、能不能跟桌面端/CLI 共享状态。
发生了什么:OpenAI 于北京时间 8/27 02:43 发布 Codex CLI 0.150.0 稳定版,最实用的变化是终端里的多条任务终于可以互相引用——当前 Agent 能读取另一条任务、创建新任务,或给已有任务直接发消息(mentions_v2 标记为 stable)。这补齐了 0.148 起的“会话可导出、分叉、归档”之后缺失的一环:长任务之间如何交接上下文。为什么重要:过去多个 Codex 任务各自为政,跨任务协作只能靠人手动复制;0.150 让“先别把上下文全交出去、用消息接力”成为可能,更接近多 Agent 编排的雏形,也为在 CI/后台跑有边界的 Agent 工作流铺路。
发生了什么:Claude Code 于 8/26 发布 v2.1.247,新增 SendFeedback 工具——当会话中某个功能持续失败、Claude 无法完成请求或它自己意识到出错时,会自动起草一份反馈报告存到本地 ~/.claude/feedback/drafts/,由你审阅、修改后再决定是否发送;同时新增 /claude-api cost-optimize,逐条拆解项目 API 开销并给出缓存、批处理、effort 调优、模型选择等降本清单;Sonnet 5 在 1M 上下文下的自动压缩阈值由约 934K 上调到约 967K,长会话多约 3 万 token 余量;另含约 20 项修复(插件市场加固、Bedrock/Vertex/Foundry MCP 诊断、跨会话消息 UX 等)。为什么重要:SendFeedback 把“出错了要事后写反馈”变成上下文自动留痕,降低了反馈门槛;cost-optimize 与压缩阈值上调都指向同一件事——Anthropic 在把 CC 的“可观测性 + 成本控制”从黑盒变成可调旋钮,对重度长任务用户是直接利好。
omp(Oh-My-Pi)是 Can Bölük 在 Mario Zechner 的 Pi 基础上大幅扩展出的终端编程 Agent:用约 8 万行 Rust 原生核心替代纯 Node 运行时,内置 31+ 工具、LSP 与 DAP 调试器集成、子 Agent 并行、40–60+ 模型提供商。它的杀手锏是 hashline 锚定编辑——用内容哈希锚点替代「重抄代码行」,直接把 Grok Code Fast 1 的编辑成功率从 6.7% 拉到 68.3%,并重命名走 LSP、segfault 走 lldb 真调试,而不是甩 print。GitHub 约 2.5 万 star、近期在用量榜 7 天 +7。它代表一类思路:Agent 强弱不只看模型,工具链(编辑格式、IDE 级智能、调试)的打磨同样能翻盘。
Zazen 是免费编程 Agent Freebuff 的一个 fork,近期在 AI++ 用量榜冲到前列(7 天排名 +6)。它继承 Freebuff 的「零成本」模式:不需要订阅、积分或 API Key,靠界面内文本广告支撑模型调用,用 DeepSeek、MiniMax 等开源/国产模型驱动,提供 CLI / 桌面 / Web / Cloud / Chat 多端形态与多智能体编排(文件拾取、规划、审查、浏览器操作为不同专用 Agent)。底层 Apache 2.0 开源,代码可自查、可二开。Zazen 这类 fork 的走红,说明「免费 + 广告 + 可选自备 Key」的三层结构在个人开发者与学生群体中确有市场,也反映出对 Cursor / Claude Code / Devin 订阅制的不满正在催生一批零成本替代品。
Ito(ito.ai)8 月 13 日登上 Product Hunt 拿下当日第 2。它的做法是给每个 PR 起一个一次性容器,用 computer-use 智能体像真人一样把受影响流程点一遍,再把视频、日志、复现步骤贴回 PR。补的是静态分析与只看代码的评审都抓不到的「行为回归」:DoltHub 用它在一个后端库里揪出 diff 完全看不出的 SQL 命名窗口 bug,6 周内约半数实质 PR 被标出问题、确认/误报比超 2:1。在 AI 写码越来越快、人 review 不过来的当下,这种「执行即证据」的思路正被当成 agentic 编码闭环里缺的那一环。
发生了什么:Claude Code 在 8/24–25 连发 v2.1.243 与 v2.1.245。v2.1.243 是近期最大一次功能更新——/usage 新增 Loops 明细(每次循环运行次数、总 token、每次 token、上次运行),可一眼定位失控的 /loop 任务;新增 modelPicker 设置自定义 /model 选择器;promptCacheTtl 与 subagentPromptCacheTtl 让主会话保 1 小时提示缓存、子代理保持 5 分钟;modelPricing 托管设置按合约费率算成本;/login 下新增无密钥的「Console 账户登录」,禁用 API key 的组织也能登录。v2.1.245(8/25)只修一处崩溃:在 glibc 2.44 的 Linux 发行版(Arch、CachyOS、Fedora Rawhide)上启动直接挂掉。为什么重要:Loops 明细与 promptCacheTtl 把「可观测性 + 成本控制」从黑盒变成可调旋钮,无密钥登录补齐企业合规最后一公里;而一行 glibc 修复背后,是 CC 对最新 Linux 系统
MiniMax M3 是 MiniMax 推出的多模态基础模型,支持文本、图像、视频输入,可生成文本输出,拥有100万token的上下文窗口,适用于长周期智能体任务、代码开发等场景,能为相关领域的高效工作提供有力支撑。
MiniMax M2.7(免费版)是一款面向自主现实场景生产力与持续优化的下一代大语言模型,它专为深度参与自身迭代而打造,通过多智能体架构集成了先进的智能体能力,能够在实际应用中主动适配需求、持续成长,为用户提供更贴合真实场景的高效服务。
发生了什么:Cline 在 8/24–25 连续推送 v4.1.14 / v4.1.15(经 SDK 包发布),内置模型目录大翻新——新增 Claude Fable 5、Vertex 上的 Grok 4.6、DeepSeek V4 Flash 多档(含视觉预览)、MiMo v2.5、Qwen3.8 27B、Gemma 4 26B、LongCat 2.0、Nemotron 3.5 Lightning,以及 Thinking Machines 的 Inkling 系列;同时修复了自定义 OpenAI-Compatible 模型在 capability 列表为空时被误剥工具调用的问题。为什么重要:Cline 把「模型路由表」当产品来做,用户换前沿模型零配置——在模型快速迭代的当下,这比单点功能更能留住重度编码用户。
发生了什么:Codex CLI 稳定版 0.149.1 于 8/24 在 npm 打上 Latest 标记发布,托管 Codex 运行时同步钉在 @openai/codex@0.149.1;与此同时 0.150 开发线(alpha.1→alpha.7,8/20–22)已落地 MCP server 事件流(start/stop 事件订阅)、可挂载到已有 call 的实时对话、TUI 权限快捷键,以及 CODEX_SANDBOX_NETWORK_DISABLED 禁网沙箱开关。为什么重要:MCP 事件流让 Codex 首次能「订阅」外部工具的运行状态,禁网沙箱则把安全边界从提示词推进到运行时——编码 Agent 正从「能跑命令」走向「可被托管环境约束」。
发生了什么:Claude Code 最新版 v2.1.241(8/22–23 发布)官方 changelog 仅写「Bug fixes and reliability improvements」,但第三方对二进制的静态分析挖出两个未在更新说明中披露的用户面特性——CLAUDE_CODE_ARTIFACT_DELETE(删除 Artifact,仅 owner、需二次确认、plan 模式与远程会话禁用)与 lower-priority 模式(Max 会话触达周限额后仍可继续工作,每次重置后再提示一次)。为什么重要:前者把「Artifact 协作」从只读变成可销毁,后者实质是给超出预算的 Max 用户留了一条不中断的活路,说明 Anthropic 在悄悄给重度用户兜底,而非单纯修 bug。
发生了什么:Anthropic 8/22 发布 Claude Code v2.1.240,仅一行「Bug fixes and reliability improvements」、无独立 changelog,相比本周动辄 40+ 条的大版本明显收敛;同期 claude-news.today 8/23 简报引 GeekNews 称,部分 Fable 5 会话(Claude Code 2.1.236+)疑似被服务端 A/B 实验调低 reasoning-effort 档位,同版本体验可能飘忽。为什么重要:v2.1.240 没有功能点可写,但服务端推理力度实验意味着「同版本不同命」——若发现响应质量莫名下降,可试 /model 切模型规避;该实验未官宣,仅影响 Fable 5 与 2.1.236+ 会话,Opus 5 与更早版本被排除。
发生了什么:OpenAI 官方 Codex changelog 确认,GPT-5.4 / GPT-5.4-mini 将于 8 月 31 日从 Codex(ChatGPT 登录会话)下线,API key 会话不受影响,需切到 GPT-5.6 Terra / Luna;同时 Assistants API 于 8 月 26 日正式移除端点,官方指引迁移到 Responses API + Agents SDK。为什么重要:对还在用 Assistants API 或 Codex 里挂 GPT-5.4 的开发者,这是 5 天内必须动手的硬截止——没有宽限期、没有自动迁移,错过即 410 Gone。建议现在盘点 assistants/threads/runs 依赖、并行跑 Responses 对照测试再切流量。
发生了什么:Anthropic 8 月 21 日发布 Claude Code v2.1.239,修复 Bedrock 在剥离响应 Content-Type 的代理后流式被静默转非流式、导致每轮重复计费的双计费 bug;新增 /claude-api upgrade 把 Python 项目从 anthropic 0.x 迁到 1.x;并把数据驻留工作区的 1.1× 美国推理溢价反映进 /cost 与状态栏。为什么重要:本周修复条目最多的版本(40+),双计费修复直接关系 Bedrock 用户的账单,Alpine/musl 原生构建也让 Claude Code 首次在 Alpine 上原生可用。
发生了什么:OpenAI 于 8 月 20 日发布 Codex CLI rust-v0.149.0,新增可交互的 codex agents 仪表盘(搜索/启动/打开/重命名/停止任务)、/cd /pwd /cwd 管理工作目录、codex queue 向已有会话发消息,并扩充 Vim 编辑动作(cw/c$/cc)。为什么重要:会话正成为一等工程单元——fork/archive/resume 之外再加仪表盘与队列,多会话协作更顺;官方同时把 DNS 泄露风险与可信 devcontainer 边界写进文档。
发生了什么:8 月 21 日 OpenClaw 主分支合并 4 个关联修复(#126928/#126877/#127071/#127015),堵住 onboarding/setup 把网关密码、令牌以明文写入 openclaw.json 的缺口,并让失败的健康检查不再把已注册密钥回显进终端/CI 日志。为什么重要:这些改动是已合并源码、尚未打包成 release(当前 npm beta 仍停在 8/15 的 2026.8.1-beta.2),所以运营者要审计的是现有安装已写盘的内容,而不是等升级——这正是明文凭据类漏洞最危险的地方。
Inkling Small 是 Thinking Machines Lab 推出的开源多模态混合专家模型,总参数达2760亿,其中激活参数为120亿,定位为该系列中体积更小、效率更高的成员,具备多模态处理能力,可适配各类轻量化场景的智能任务需求。
Inkling 是 Thinking Machines Lab 推出的一款开放权重的混合专家多模态模型,总参数规模达9750亿,其中激活参数为410亿。
北京大学等机构研发,分层动作流结合频谱潜空间RL,七项家庭任务得分提至70.5%
上海创智学院等构建VAPref-10K数据集,比单项指标更贴合人类观看体验
华盛顿大学等研发,同一模型分饰出题人与解题者,延缓任务池饱和
上海交大等提出,拆分技能选择与执行奖励,9B模型成功率提至53.2%
清华等研发,纯图像三维跟踪达66.9 MOTA,覆盖16个路口问答对
中科院等提出,多项式时间算法处理整数与有理数的顺序关系
UIUC等研发,全局图文匹配生成可靠伪标签,分布偏移任务提7个百分点
港理工等构建六层分类体系,为基础模型研究建立统一参照
港中大研发,以参数化观测器转化问题,数据条件比传统方法更宽松
武大等提出,无需修改指令,虚假状态可传导到真实动作
英矽智能研发,多答案生成替代单答案评价,分布外基准领先
蒙特利尔学习算法所等研发,分阶段开放记忆区块,16K检索任务提5.8个百分点
人大等研发,两阶段蒸馏,推理速度提57至2866倍
人大等研发,纯CPU生成查询,令牌消耗攻击效果超基线
南大等提出,步骤级监督,ALFWorld任务成功率提至84.29%
港科大广州等研发,形式化探索结合神经符号修复,断言数量提一倍
南大等研发,统一建模视角焦距滤镜,接近实时交互重摄影
复旦等研发,双门控可控扩散结合多意图蒸馏,已在数亿日活部署
上交等构建168个任务,分Apply/Repro/Resolved指标,Kimi-K3修复率66.7%
上交等构建跨平台基准,Pass@1跨度达68.5个百分点
发生了什么:社区负责人 Hannes Rudolph 8/19 解释近期迭代放缓原因——团队对存储与数据管理做了彻底重构,新版本约 8/18 发布,主打一键式 Onboarding、简化安装升级与长会话稳定性,官方确认将原生支持「自主改进循环」。为什么重要:OpenClaw 正从「个人 Agent 网关」向更稳健的可持续运行平台演进;长会话卡顿与运维复杂度是大规模自托管的两大拦路虎,这次重构直接关系到它能否承接企业级负载。
发生了什么:LangChain 8/18 发布 LangSmith Tuned Evaluators,首发 Perceived Error 评测器——用后训练专用模型从对话信号(用户纠正、矛盾、未解决结果)推断 Agent 是否搞错方向,无需手写 prompt 或前沿模型判官,结果 12 小时内回写生产 trace。为什么重要:绝大多数用户从不主动打分,这种「推断式」自动评估把生产环境 Agent 质量监控变成可规模化、低成本的默认能力;官方称专用模型基准超过所有前沿模型且评估成本降低 82%,让中小团队也能持续评测。
发生了什么:OpenAI 于 8/18 发布 Codex CLI v0.148.0,新增 /export 将 TUI 会话导出为 Markdown、codex exec fork 对会话分叉、可从恢复选择器归档/还原会话,并首次把 Amazon Bedrock Runtime 列为内置模型供应商;hooks 支持异步命令与 MCP 工具调用,/status 显示线程级成本。为什么重要:会话正从「单次请求」变成「可分支、可恢复的工程线程」,且 Codex 开始把部署栈(Bedrock)纳入自身,与 Cursor 自托管代码、Claude Code 加固长会话形成同一轮「agent 基础设施」竞争。
发生了什么:Cline 于 8/14 发布 v4.1.10,通过 SDK 包为支持联网的模型新增「任务期间搜索网络」开关(Feature Settings 中开启,默认关闭),搜索调用与结果直接出现在对话里并在刷新后保留;同期刷新模型目录、新增 Crusoe 提供商,并修复两处 Cline 实例互杀 Hub 守护进程导致的会话中断。为什么重要:这把 Cline 从「本地化代码孤岛」补上了实时取证能力——查最新框架迁移文档、确认 API 签名不再靠瞎猜,但默认关闭也说明团队在幻觉风险与能力之间主动留了闸门。
发生了什么:安全跟踪站 The Claw Report 8/17 将 OpenClaw npm 包新漏洞(编号 CVE-2026-26323)列入告警,建议升级依赖并审计 lockfile 与令牌;此前国家互联网应急中心(CNCERT)已发布 OpenClaw 安全应用风险提示,点名提示词注入、误删、恶意 skill 投毒与多处高中危漏洞;360 安全云亦确认其独家发现的 OpenClaw Gateway WebSocket 无认证升级 0day(已报送 CNVD)。为什么重要:当 agent 被授予文件系统/环境变量/API 高权限,「自主执行」与安全边界的矛盾集中爆发,部署前必须做网络隔离、凭证管理与插件来源管控。
发生了什么:OpenAI 的 Tibo Sottiaux(@thsottiaux)于 8/17 公布在 Codex CLI 用 GPT-5.6 Sol 开启 105 万 token 上下文窗口的三行 config.toml 配置(model_context_window=1000000、auto_compact 阈值 90 万),此前该能力仅 API key 可用,现 ChatGPT/Codex 账号也可开启。为什么重要:长代码库与多文件会话大幅减少压缩次数、降低摘要漂移;但 OpenAI 强调默认值已为性能与成本精心调优,扩窗会带来更高单次请求开销,订阅用户实际生效上限可能低于配置值。
发生了什么:Nous Research 于 8/17 为 Hermes Agent 桌面端推出 Bot Mode,把既有 agent 档案转为具名 Bot,每个 Bot 拥有独立角色、模型、记忆与技能,并支持 Bot 间相互通信。为什么重要:从单一通用助手转向可持久化的「专家战队」,按任务匹配推理成本与能力,是开源 agent 从会话列表走向工作台的标志性一步。
发生了什么:Anthropic 于 8/17 发布 Claude Code v2.1.234(5 项新增、约 30 项修复)。会话在 claude.ai 用量上限重置后自动恢复(/config 可关),内置 claude-api 技能的上下文成本从约 20 万 token 降到约 2.5 万,并新增 GitLab MR 页脚/状态栏徽标与 /goal 后台任务 30 分钟检查点。为什么重要:长任务与隔夜批处理不再因限流卡死,重度 API 开发者的上下文预算也更宽裕,同时进一步封堵 Windows NT 命名空间路径的 NTLM 凭据泄漏面。
复旦、上海AI实验室打造,分工式智能体让开源模型航拍推理准确率超闭源大模型
Meta与纽约大学发现,400万参数小模型也存在缩放规律,此前因调参不足未被发现
上交等机构研究,蒸馏后模型在大采样预算下追平甚至反超原模型,仅优化正确路径概率分布
Salesforce与UIUC提出,通过测试时外部推理脚手架,GPT-5.4-mini准确率提升86.7%
字节Seed与清华推出,通过逆默认习惯的规则测试,修正传统评测对服从能力的高估
人大高瓴AI学院研究,首次定义对称性下确界,指导等变模型特征选择避免信息丢失
新浪微博提出,将算力从多生成转向关键主张证伪,准确率与Token消耗可同时优化
复旦NLP组打造,以五维度审美批评为中间层,SongEval评分误差降低19.4%
全球模型用量
近 30 天 · OpenRouter 日用量 · 当天用量次日更新
