关于这个博客 这个博客会主要记录我对 AI 论文、算法思想和工程实践的理解。 我希望每篇文章都尽量回答三个问题: 这篇论文或技术真正解决了什么问题? 它的核心假设、方法设计和实验结论是否站得住? 如果把它放到真实系统或后续研究里,它给我的启发是什么? 后续内容会以论文阅读、方法拆解、实验复现、工程经验和研究想法为主。相比只摘录结论,我会更重视自己的判断:哪里简单有效,哪里可能被过度包装,哪里值得继续追。 一 2026-07-01 Blog #AI #Research #Notes
推荐系统笔记 01:推荐系统概述 本篇整理推荐系统的整体框架,主要是”王树森推荐系统“的课程笔记 推荐系统看起来是在回答一个很简单的问题: 这个用户接下来可能喜欢什么? 但真正落到工业系统里,它不只是一个模型问题。它同时是数据问题、检索问题、排序问题、评估问题,也是一个非常强的工程系统问题。 比如短视频、广告、电商、新闻流、音乐、论文推荐,它们表面上都在推荐 item,但目标并不完全一样: 短视频可能更关心观看时长、完播、互 2026-01-05 推荐系统笔记 #笔记 #推荐系统 #召回 #排序 #CTR #CVR #序列建模
后训练笔记 04:GRPO变体与DPO变体 这一篇整理 GRPO 的变体,以及DPO的变体。 所以这一篇分成两条线: GRPO 变体:围绕 RLVR 里的 group sampling、advantage、clipping、sequence-level 更新做改造 KTO:围绕 preference data 的形式做改造,从 pairwise preference 变成 binary feedback GRPO 的基本问题 GRPO 2025-11-22 后训练笔记 #笔记 #后训练 #GRPO #DAPO #GSPO #KTO #偏好优化
后训练笔记 03:PPO、DPO 与 GRPO 本篇梳理RLHF算法:PPO、DPO 和 GRPO。 这三个方法经常一起出现,但它们解决的问题不完全一样。 PPO 是经典 RLHF 路线里的 policy optimization 方法。 DPO 是直接从偏好对里学习,不显式训练 reward model,也不跑在线 RL。 GRPO 是 reasoning model 里很常见的 RLVR 方法,用同一个 prompt 下的一组 respon 2025-11-15 后训练笔记 #笔记 #后训练 #RLHF #RLVR #PPO #DPO #GRPO
后训练笔记 02:SFT 与 PEFT 本篇介绍SFT 和 PEFT。 在大模型后训练里,SFT 通常是第一步。Base model 经过大规模预训练后,已经学到语言、知识和模式,但它不一定会按指令回答。SFT 的作用就是教模型遵从指令 PEFT则是SFT的一种解法(即parameter efficient fine-tuning:模型太大,全参数微调成本太高,所以只训练很少一部分参数,让模型适配新任务。 SFT在学啥 Base mod 2025-11-08 后训练笔记 #笔记 #后训练 #SFT #LoRA #Prefix Tuning #P-Tuning #PEFT
后训练笔记 01:强化学习基础 大模型后训练里的 RL 和传统 RL 不太一样。传统 RL 常见场景是 agent 在环境里反复交互,比如机器人控制、游戏、推荐系统。LLM 后训练里的“环境”往往更窄:给一个 prompt,模型生成 response,然后由人类偏好、reward model、规则 verifier、测试用例或者答案匹配器给出反馈。 有一说一,传统RL学起来真有点烧脑子的😓 语言模型里的 policy 是什么 2025-11-01 后训练笔记 #笔记 #强化学习 #后训练 #RLHF #RLVR
现代大模型笔记 04:Reasoning Model,从 CoT 到 DeepSeek-R1 ”三思而后行“ 这是机器人先祖给AI的教诲 简单的说,告诉模型”Let’s think step by step”效果意外的好了很多,然后就开始卷模型的reasoning了。 本篇从 CoT 开始,逐步过渡到 DeepSeek-R1 这类模型。 普通 next token prediction 的限制 语言模型的基本目标是预测下一个 token: \[ \max_\theta \sum_t \ 2025-09-27 现代大模型与前沿论文笔记 #笔记 #大模型 #Reasoning #CoT #DeepSeek-R1 #强化学习
现代大模型笔记 03:LLM 推理与效率优化 有一个挺有意思的说法:算法就是数据,数据就是 Infra,Infra就是算法。 模型能力的提升离不开数据质量,而大规模数据处理、训练和部署都离不开 Infrastructure。 先划清推理加速的边界 推理加速主要优化三个目标: 降低延迟(latency) 提升吞吐量(throughput) 降低显存或内存占用(memory footprint) 这三个目标不一定同时改善。 比如增大 ba 2025-09-20 现代大模型与前沿论文笔记 #笔记 #大模型 #推理优化 #KV cache #vLLM #SGLang #TensorRT-LLM #FlashAttention
现代大模型笔记 01:Transformer 架构与现代改进 transformer架构图 本篇整理Transformer架构以及它在现代 LLM 里发生了哪些变化。 从图中可以看到,几个核心的步骤分别是: 1. word embedding 2. positional embedding 3. 注意力机制 4. Residual Connect 5. Normalization 6. FFN 原始 Transformer的encoder-decode 2025-09-06 现代大模型与前沿论文笔记 #笔记 #大模型 #KV cache #Transformer #RoPE
深度学习笔记 05:注意力机制 本篇介绍注意力机制,参考stanford 224n的attention一课 RNN 的瓶颈 RNN 处理序列时,每个时间步依赖上一个 hidden state: \[ h_t = f(x_t, h_{t-1}) \] 这带来两个问题。 第一,长距离信息要经过很多步传递,容易衰减。 第二,计算难以并行,因为第 \(t\) 步必须等第 \(t-1\) 步算完。 比如翻译一句话时,目标词可能需要关注源句 2024-08-31 深度学习笔记 #深度学习 #笔记 #注意力机制 #自注意力