GRPO(Group Relative Policy Optimization)是 DeepSeek 在 DeepSeek-Math 和 DeepSeek-R1 中使用的强化学习算法。 它把 PPO 里的价值网络(Critic)砍掉,改用「一组采样取相对排名」来估计优势函数,显著降低训练成本。 这是开源社区能复现 o1 式推理模型的关键一步——不需要巨大的 critic,也能训出会反思的模型。
技术解读
vLLM 引入的 PagedAttention 借鉴 OS 分页内存管理,把 KV cache 切成定长 block 按需分配。 它消灭了 KV cache 的内部/外部碎片,让显存利用率从 ~30% 提到 ~90%+,吞吐翻倍以上。 还顺带解锁了「连续批处理」和「前缀共享」两个杀手锏,是开源 LLM serving 的事实标准。
o1 类推理模型证明:在推理时投入更多算力(更长的思维链、多次采样、搜索验证),能换回明显更强的推理能力。 这把「模型能力」从单纯依赖参数量,扩展成「参数量 × 推理算力」两个维度,催生了新的扩展规律。 它不是免费午餐——test-time compute 有收益递减,且和训练时算力是替代关系,关键是怎么分配。
CPO(Co-Packaged Optics,共封装光学)是 AI 集群互连从可插拔光模块走向光引擎与交换 ASIC 同封装的范式转移。传统方案里每个交换机端口插一个独立光模块,电信号在板级走线十几厘米才转成光,带来电阻损耗、散热与故障点;CPO 把硅光引擎直接焊在交换芯片封装旁,电通道压缩到毫米级,激光器总数减少约 4 倍、网络功耗降约 5 倍(行业测算相对可插拔降约 80%)、MTBI 提升约 10 倍。本文讲清 CPO 相对 LPO、NPO 的演进路径、功耗与可靠性为何改善、以及它把封装、耦合、测试升级为晶圆级工艺后抬高了哪些壁垒与代价,并说明它并非万能——对外跨机柜互联仍依赖可插拔模块。
Hermes Agent v0.20.6 把三件事一起落地:consent-gated 真实浏览器画像浏览、可选 OS 钥匙串加密存储密钥、以及 50+ 家现场验证的远程 MCP 目录。它们共同指向一个被忽视的问题——Agent 要干活就得碰你的钥匙(浏览器会话、API Key、本地文件),而过去大多数方案要么明文存密钥、要么无差别放行工具。本文拆开这三道机制的取舍,并对照 Claude Code、Codex 的做法,说明 Agent 安全边界正在从「不让他碰」转向「有凭证地、可审计地让他碰」。
传统 AI 代码评审大多把改动行喂给 LLM 让它「猜」问题,但生产环境的 bug 往往 diff 干干净净、只在真实数据流动时才暴露(过期会话把用户踢进登录死循环、mock 的依赖通过而真实 API 挂掉)。执行式评审换了一条路:在每个 PR 起一个一次性容器,用 computer-use 智能体像真人一样把受影响流程点一遍,再把视频、日志、复现步骤贴回 PR。典型例证是 Ito 在一个后端库里揪出 diff 完全看不出的 SQL 命名窗口 bug,6 周内约半数实质 PR 被标出问题、确认/误报比超 2:1。它的边界也很清楚:不替代安全精读与探索性测试,原生移动端仍在路线图上;价值在于把「人工点一遍流程」的回归层自动化,让 agentic 编码闭环里终于有一步「真去验证它真的能跑」。
DPO(Direct Preference Optimization)把 RLHF 的「训奖励模型 + 跑 RL」两步,压缩成「直接在偏好数据上做监督学习」一步。 它的数学核心是:最优策略可以用奖励函数闭式表达,于是奖励被策略隐式定义,RL 循环整个消失。 上手简单、训练稳定,是当前最流行的对齐方法之一;但它不是 RLHF 的等价替代,有自己的边界。
MLA(Multi-Head Latent Attention)是 DeepSeek-V2/V3 用来压缩 KV cache 的注意力变体。 核心是把每层的 K、V 先压成一个低维 latent 向量存进 cache,attention 时再上投影还原,KV cache 直接缩到原来的 ~7%。 为了不牺牲质量、还要兼容 RoPE,它用了一个「解耦 RoPE 头」的精巧设计,是工程与数学结合的典范。
传统 MoE 用一个辅助损失(auxiliary loss)逼专家负载均衡,但这会干扰主任务、拉低最终质量。 DeepSeek-V3 提出无辅助损失的均衡方案:在路由打分上加一个动态 bias,bias 由负载统计更新而非梯度驱动。 这样均衡控制彻底脱离主损失,模型质量回升、训练更稳,是 MoE 工程化的重要一步。
Mamba 系列是 Transformer 之外最有影响力的架构路线,用状态空间模型(SSM)实现线性时间推理、常数显存。 Mamba-1 的关键创新是「选择性」——让 SSM 参数随输入变化,能像 attention 一样选择性记忆或遗忘。 Mamba-2 证明了 SSM 和 Attention 存在对偶关系,于是把 SSM 写成矩阵乘法、复用 GPU tensor core,训练大幅提速、状态维度可放大。
投机解码用一个小的 draft 模型快速「猜」出若干 token,再用大模型一次性并行验证,猜对的直接采纳、猜错的从错处回退。 它在数学上保证输出分布和大模型单独生成完全一致——加速但无损。 EAGLE 进一步让 draft 模型复用大模型的隐状态作输入,猜测质量大幅提升,2~4 倍加速成为常态。
FlashAttention 系列靠「分块 + 重计算」避免实例化完整 N×N 注意力矩阵,把注意力从显存密集变成计算密集。 FA3 针对 H100 的异步数据搬运和 FP8 tensor core 重新设计 kernel,让 softmax 与 GEMM 重叠执行。 相比 FA2,FP16 下约 1.5~2 倍提速,FP8 下再翻倍,长上下文场景尤其受益。
Ring Attention 把超长序列切到多张 GPU 上,每张卡只持有一段 Q/K/V,按环形拓扑轮流交换 K/V 块。 关键是让「算当前块的 attention」和「传下一块 K/V」重叠,把通信藏到计算后面。 转一圈后每张卡都见过全部 K/V,于是上下文长度能随 GPU 数线性扩展,支撑百万 token 训练。
AWQ(Activation-aware Weight Quantization)是大模型权重量化的代表性方法,把权重压到 4-bit 几乎不掉点。 核心洞察:不是所有权重通道都同等重要,激活大的「显著通道」权重量化误差会被放大,必须重点保护。 用 per-channel scaling 把显著通道在量化前放大、反量化时缩回,等效于给重要通道更高精度,实现简单、硬件友好。
朴素 RAG(检索 top-k 片段塞进 prompt)在简单问答上有效,但面对多跳推理、全局摘要、信息冲突时力不从心。 进阶 RAG 沿两条线演进:Self-RAG 让模型学会「何时检索、检索是否相关、答案是否有据」;GraphRAG 把文档结构化成知识图谱,支持跨文档的全局问答。 它们把检索增强从「外挂记忆」升级成「会思考的检索-推理系统」,是 RAG 走向生产可靠的关键。
