Paper 阅读笔记

围绕推测解码、端侧推理、量化、LoRA 和 test-time scaling 的论文阅读笔记

Paper 阅读笔记

这里整理的是我当前重点关注的几条路线:推测解码、端侧推理、量化、高效微调和推理时扩展。整体写法尽量统一成“论文要解决什么 -> 核心结构/方法 -> 我自己的判断”,方便后续继续加图和补实验。

  • 已完成:内容与结构已经基本稳定,可直接展示。
  • 🚧 TODO:已有初稿,但仍在继续补图、补实验或调整结构。

1. 推测解码

文章 主要内容 状态 链接
推测解码主线 Lookahead、MEDUSA、EAGLE、EAGLE-2、EAGLE-3,以及后续并行化路线 🚧 TODO 传送门
草稿模型训练 Scaling Law、小模型实证、MAGICDEC、Hidden State SD、SSD ✅ 已完成 传送门

2. 端侧推理

文章 主要内容 状态 链接
端侧推理总览 端侧 LLM 的存储、稀疏、NPU、调度与 benchmark 视角 🚧 TODO 传送门
LLM in a Flash 闪存作为权重缓存,解决“模型放不下” 🚧 TODO 传送门
PowerInfer-2 神经元稀疏 + 动态权重加载 🚧 TODO 传送门
Fast On-device LLM Inference with NPUs NPU-first 路线与指令级融合 ✅ 已完成 传送门
shadowAttn 面向 Mobile SoC 的动态稀疏注意力 🚧 TODO 传送门
HeteroLLM CPU/GPU/NPU 异构切分与协同 🚧 TODO 传送门
Agent.xpu Agent 工作负载的 SoC 调度 🚧 TODO 传送门
LLM Inference at the Edge NPU 与 GPU 的移动端 benchmark 🚧 TODO 传送门
Scaling Test-time Compute for LLM Agents 端侧小模型靠推理预算补能力 🚧 TODO 传送门

3. 量化

文章 主要内容 状态 链接
LLM 量化技术 LLM.int8()SmoothQuantAWQ 的主线比较 🚧 TODO 传送门

4. 高效微调

文章 主要内容 状态 链接
LoRA 微调路线 LoRAQLoRAPISSALoRA-GA 🚧 TODO 传送门

5. Test-time Scaling

文章 主要内容 状态 链接
Test-time Scaling Scaling LLM Test-Time Compute OptimallyInference Scaling Laws 🚧 TODO 传送门

6. 推理系统

文章 主要内容 状态 链接
推理系统优化 RooflineFlashAttentionPagedAttentionContinuous Batching 🚧 TODO 传送门
Licensed under CC BY-NC-SA 4.0
最后更新于 2026-04-15