小红书技术REDtech

小红书发布大模型新架构 PIPO ,让模型一次「吞两个、吐两个」

Image

长链路推理已成为大模型能力提升的核心路径,但动辄上万 token 的推理轨迹让自回归解码的首字延迟和逐 token 成本成为瓶颈。为了解决效率瓶颈,小红书大模型基建团队提出新架构 PIPO(Pair-In, Pair-Out):在模型输入侧,压缩器把两个输入 token 折叠成一个 latent;在模型输出侧,MTP head 把一个隐藏状态展开成一个额外输出 token;进而实现减半输入长度、双倍每步输出长度。在 AIME 2025、GPQA-Diamond、LiveCodeBench v6 和 LongBench v2 四个基准上,PIPO 基于 Qwen3.5-4B / 9B backbone 最高带来 +7.15 pass@4 提升。在更大量级业务模型的部署级测评基准上,PIPO 在展现了无损性能的同时,将 TTFT 加速约 1.23×,TPOT 加速约 1.86×。

关键词:

LLM 推理,长链路思考,Latent Compression,Multi-Token Prediction,Speculative Decoding,On-Policy Distillation,推理加速

论文地址:

https://arxiv.org/pdf/2605.27255

工程项目地址:

https://github.com/redai-infra/PIPO

Image
Image

在现代 reasoning LLM 中,真正贵的不是「给一个短 prompt 生成一句话」,而是持续生成成千上万 token 的推理轨迹。标准自回归解码有两个天然限制:

  1. 输入侧越长,prefill 越重。 Prompt、历史思考和已生成内容都会进入上下文,模型每一步都要在越来越长的前缀上计算。

  2. 输出侧一次只出一个 token。 即使模型内部已经具备 MTP head,可以预测额外 token,如果没有可靠接受机制,草稿 token 的错误会沿着长推理链不断放大。

因此,已有方法通常沿两条路线优化:

  • 输出侧加速: speculative decoding 先用 draft 模型生成候选 token,再用大模型 verifier 校验;EAGLE 把草稿生成扩展到 hidden feature 空间;Qwen、DeepSeek 等新一代模型也逐渐内置 MTP head。但 verifier 仍然要反复跑完整 backbone,尤其在长上下文下,校验成本会抵消多 token 预测带来的收益。

  • 输入侧压缩: Coconut、Soft Thinking、CoLaR 等方法尝试把部分 token-level reasoning 替换为连续 latent 表示,从而减少有效序列长度。但它们主要解决「输入变短」的问题,没有改变输出端每一步只生成一个 token 的节拍。

PIPO 的目标就是把两边统一起来:既然压缩器可以把两个 token 合成一个 latent input,MTP head 也可以从一个 hidden state 预测额外 token,那么系统就应该围绕「token pair」重新组织训练和推理。

Image

观察一:latent compressor 和 MTP head 是镜像操作。

输入侧的 compressor 做的是「折叠」:把连续两个 token embedding 拼接后映射成一个 latent representation。

输出侧的 MTP head 做的是「展开」:在 backbone 预测下一个 token 的同时,再基于 hidden state 和刚预测出的 token 预测一个 draft token。

这两个操作刚好围绕 backbone 对称:

  • pair-in:两个输入 token → 一个 latent 输入;

  • pair-out:一个 backbone step → 一个主 token + 一个 draft token。

这样一来,PIPO 可以把有效输入长度近似减半,同时把单步输出量最高提升到 2 倍。

观察二:OPD teacher 本身就是 speculative decoding 里的 verifier。

在 speculative decoding 中,verifier 用强模型分布判断 draft token 是否应该被接受;在 On-Policy Distillation(OPD)中,teacher 也用强模型分布逐位置监督 student。两者本质上都在回答同一个问题:student / draft 的输出是否和强模型参考分布一致?

PIPO 利用这个等价关系,训练了一个轻量 confidence head。它的标签直接来自 OPD 中已经计算好的 teacher / student 概率比:min(p_t(x) / p_s(x), 1)

也就是说,PIPO 不再在推理时反复调用大模型 verifier,而是在训练阶段把 verifier 的判断能力「蒸馏」进一个小 MLP。推理时,只需一次极轻量的 confidence head 前向,就能决定 draft token 是否接受。

Image
Image

PIPO 的架构可以概括为三部分:pair-in compressor、pair-out MTP prediction,以及 confidence-guided draft acceptance。

Pair-in compression:两个 token 合成一个 latent。

PIPO 每次取两个连续 token embedding,并通过一个 MLP compressor 映射为一个 backbone 可消费的 latent 输入。为了避免一开始就把 backbone 推到预训练分布之外,compressor 被初始化为近似 a + b:也就是让两个 token 的合成表示在训练初期尽量接近原模型熟悉的 embedding 几何。

后续分析显示,训练后的 compressor 并不是简单求和。它保留了 additive geometry,同时学会了 position-aware projection:既知道两个 token 分别是什么,也知道它们在 pair 里的顺序。

Pair-out prediction:一个 backbone step 预测两个 token。

在每个 pair step 中,backbone 基于压缩后的 latent prefix 预测主 token;随后,MTP head 根据 backbone hidden state 和主 token embedding 再预测一个 draft token。由于 Qwen3.5 等现代模型已经内置 MTP head,PIPO 不需要从零构造复杂的新 decoder,而是把现成的 MTP 能力接入 pair-level interface。

Confidence-guided acceptance:用小头替代大 verifier。

draft token 并不总是可靠。PIPO 给每个 draft token 预测一个置信度 c:

  • 如果 c >= τ_c,接受 draft token,下一个输入 pair 就包含两个新生成 token;

  • 如果 c < τ_c,拒绝 draft token,用 PAD embedding 占位,下一个输入 pair 退化为「主 token + PAD」。

这个设计让 PIPO 在不确定时可以安全回退到近似单 token 解码,而不需要额外跑一遍 backbone verifier。论文中的 PAD 分析也验证了:compressor 会把带 PAD 的 pair 近似视为「只剩下非 PAD token」,不会污染后续 hidden state。

训练上,PIPO 分成 SFT 和 OPD 两个阶段。

SFT 阶段:先学会 pair-level 解码。

PIPO 用 next-pair prediction objective 训练模型同时预测主 token 和 draft token。为了让模型提前适应「draft 被拒绝」的情况,训练时会随机把一部分 draft-position 输入替换为 PAD embedding。confidence head 在这一阶段也会被 bootstrap:它学习 draft token 在学生分布下的概率,让置信度先和 draft 可靠性建立相关性。

OPD 阶段:让模型在自己的分布上学习,并把 verifier 蒸馏进 confidence head。

SFT 只让模型看 ground-truth 轨迹,无法完全覆盖推理时自己生成的分布。OPD 会先让 PIPO 按当前策略 rollout,再把生成序列中的 PAD 去掉,喂给未压缩 teacher,得到每个位置的 teacher distribution。student 随后通过 reverse-KL 对齐 teacher。

最关键的是,OPD 已经计算了 p_t 和 p_s,正好可以复用为 speculative decoding 的接受概率标签。因此 confidence head 的监督几乎是免费的:不需要额外 teacher forward,不需要人工标注,也不需要推理时再调用 verifier。

Image

实验中,PIPO 使用 DAPO-Math 和 Codeforces 训练,SFT 数据来自 Qwen3.5-9B teacher 采样出的正确轨迹,共约 9.6 万条样本,平均长度约 24.9K token。评测覆盖四类高难任务:

  • AIME 2025: 数学竞赛题;

  • GPQA-Diamond: 研究生级理化生多选题;

  • LiveCodeBench v6: 近期竞赛编程题;

  • LongBench v2: 长上下文推理题。

所有方法共享 Qwen3.5-4B / 9B backbone,并在相同 32K-slot response budget 下比较 Regular decoding、MTP、EAGLE-2、PIPO-SFT 和 PIPO + OPD。

Image

主要结果显示,PIPO 是两个 backbone 上最强的 pass@4 方法。

在 Qwen3.5-4B 上,PIPO + OPD pass@4 达到 67.31,相比最佳 baseline 提升 +3.83。

在 Qwen3.5-9B 上,PIPO + OPD pass@4 达到 75.18,相比最佳 baseline 提升 +7.15。

Image

效率方面,PIPO 同时优化 TTFT 和 TPOT。

TTFT:长上下文下最高 2.64× 加速。

Regular decoding 的 prefill 需要处理完整 prompt,因此 TTFT 会随输入长度快速上升:在 Qwen3.5-4B 上,PIPO 通过 pair-in compression 把有效 prefill 长度减半,在 2K 输入下已有 1.65× 加速,在 128K 输入下达到 2.64×(20.3s → 7.69s)。上下文越长,prefill 越占主导,PIPO 的相对收益也越明显。

TPOT:逐 token 最高 2.07× 加速。

逐 token 生成成本主要来自 backbone forward。由于 PIPO 和 MTP 一样每步最多输出两个 token,TPOT 近似减半;同时,PIPO 的压缩前缀也缩小了 KV cache,因此整体更快。在 2K 输入下,PIPO 的 TPOT 相比 Regular 达到 2.07× 加速;在 128K 输入下仍保持 1.98× 加速。

Image
Image

消融实验进一步说明,PIPO 的每个设计都不是可有可无:

Compressor 需要非线性:

把默认 MLP compressor 换成单线性层,会让 pass@4 从 65.01 降到 60.38,下降 4.63 个点。两个异质 token 的融合不是简单线性映射就能完成,模型需要非线性变换来学习可被 backbone 消费的 pair latent。

SFT 需要多样化正确轨迹:

如果每个问题只保留最短正确回答,pass@4 会下降 5.14 个点。长链路推理不是单一路径问题,多条正确轨迹能帮助模型学习更丰富的 next-pair 预测模式。

Compressor 初始化非常关键:

如果不使用近似 a + b 的初始化,而是随机初始化 compressor,pass@4 会从 65.01 降到 57.73。这说明 pair-in latent 必须尽量从 backbone 熟悉的输入分布附近开始训练,否则早期 SFT 会不稳定。

Confidence head 学到的不是简单接受率:

论文对不同 acceptance threshold 做了扫描,并用随机接受 baseline 对齐相同 pad ratio。结果显示,在所有中间 pad ratio 下,confidence head 都优于随机接受;例如 pad ratio 约 0.6 时,confidence 达到 61.93 pass@4,而随机只有 59.64。这说明 confidence head 真的学会了区分「该保留的 draft」和「该拒绝的 draft」,而不只是控制接受数量。

Image

PIPO 给出的更大启示是:下一代 reasoning LLM 的推理系统不应该只围绕「单 token 输入、单 token 输出、反复 verifier」来设计。随着 MTP head 逐渐成为强模型的标配,latent compression 也在不断成熟,输入侧和输出侧其实可以被统一到同一个 pair-level interface 中。

从系统角度看,PIPO 做了三件事:

  1. 把输入长度压短。 Pair-in compressor 让 prefill 和后续上下文维护更轻;

  2. 把输出节拍放大。 Pair-out MTP 让单次 forward 贡献更多推理内容;

  3. 把 verifier 成本前置。 OPD 把强模型校验信号蒸馏进 confidence head,避免推理时反复跑大模型 verifier。

这条路线尤其适合长链路 reasoning:模型仍然可以生成充分的中间思考,但每个 token 的边际成本被显著降低。未来,PIPO 还可以继续扩展到更大的 compression factor、更大规模模型、开放式生成任务,以及多模态模型中的 modality-specific compressor。它指向的是一种新的推理架构:让大模型不再被单 token 解码节拍束缚,而是在输入和输出两侧同时获得更高的信息吞吐。

Image

我们是小红书大模型基建部,负责公司级 AI 大模型全链路基础设施建设(Github主页https://github.com/redai-infra)。团队完整闭环「算力 - 框架 - 平台」,致力于解决产业级大模型生产效率问题,构建了 Relax 训练框架、RedSlim 压缩工具、rLLM 推理框架、DirectLLM MaaS 系统和 QuickSilver 大模型平台等核心产品。我们致力于打造小红书面向 AI 时代的生产力底座,在训练、推理、压缩、MaaS、算力和 Agent 等方向持续建设领先、可靠、易用的 AI Infra 能力,让模型能力像水电一样稳定、普惠、低成本地服务社区、大商业、国际化、审核、企业智能等核心业务场景,并推动小红书在大模型 Infra 领域形成清晰的行业辨识度与长期技术影响力。

重点建设及探索方向:

  1. 长文多图千卡 RL 训练:面向长上下文、多模态与 Agentic 任务,探索万亿参数模型在千卡集群上的高稳定、高效率训练。

  2. Agentic 长文高效推理:面向 DeepResearch、多轮 Agent 等复杂推理场景,优化 KV Cache、PD 分离、请求调度与端到端成本。

  3. Efficient LLM 加速算法:探索量化、稀疏化、低秩压缩、蒸馏等技术,让大模型以更低显存、延迟和成本服务核心业务。

  4. 大模型 Token Hub:建设统一承载开源、商用、自研模型的公司级 MaaS 系统,实现多模型接入、智能路由与高可用服务。

  5. AI Native 大模型平台:构建覆盖算力管理、大模型生产、Agent 开发、工具调用、应用编排与业务接入的 AI Native 一体化平台。

  6. 万卡集群异构算力调度:面向 GPU / NPU / 多地域多卡型环境,建设统一算力底座,探索万卡训推混部、弹性伸缩、潮汐调度技术。

Image

社招岗位:

校招&实习岗位:

  • 【REDstar】大模型 RL Training Infra 工程师:小红书招聘

  • 【REDstar】大模型 Efficient Inference Infra 工程师:小红书招聘

  • 【Ace顶尖实习生】全模态Agent长程任务RL算法+工程Co-Design研究:小红书招聘

  • 【Ace顶尖实习生】全模态大模型理解与生成轻量化及加速算法研究:小红书招聘

欢迎关注大模型基建部小红书账号,我们将在上边分享更多 AI 基建技术探索与招聘信息~

Image
Image