Agentic RAG:从结果监督走向过程奖励 复杂问答中的 Agentic RAG 不只是“检索一次再回答”。模型需要持续判断当前证据是否足够、下一次应该检索什么,以及什么时候停止。只给最终答案奖励,往往难以定位中间步骤在哪里发生了偏移。 2026-08-07 科研札记 > Agentic RAG #RAG #LLM #Reinforcement Learning
大模型 RL 后训练:PPO、DPO 与 GRPO 从数据、目标函数和训练组件三个角度比较 PPO、DPO 与 GRPO,并讨论它们在大模型后训练中的适用场景。 2026-03-12 学习笔记 > 强化学习 #RLHF #PPO #DPO #GRPO #LLM Post-training
算法题分类:从题目特征到解题模型 按连续性、单调性、状态重复和搜索目标整理算法题型,建立从题目特征到数据结构与算法模型的映射。 2026-01-16 算法笔记 > 解题框架 #LeetCode #动态规划 #回溯 #数据结构 #面试算法
LeetCode 题型框架:滑动窗口与二分边界 从题目识别信号出发,整理可变滑动窗口、左右边界二分与答案二分的统一模板和常见陷阱。 2026-01-15 算法笔记 > LeetCode #滑动窗口 #二分查找 #双指针 #Python
数据集蒸馏方法谱系:从双层优化到轨迹匹配 从优化目标出发,梳理数据集蒸馏中的双层优化、梯度匹配、分布匹配、轨迹匹配与规模化路线。 2025-10-31 论文阅读 > 数据集蒸馏 #Dataset Distillation #Data-Centric AI #Gradient Matching #Trajectory Matching
生成式数据集蒸馏:从潜空间优化到生成器蒸馏 阅读 GLaD、GDD 与 D2M 后,对生成式数据集蒸馏的优化空间、泛化能力和规模化问题进行梳理。 2024-12-10 论文阅读 > 数据集蒸馏 #Generative Prior #Diffusion Models #GLaD #D3M
最短路算法:Bellman-Ford、Dijkstra 与 Floyd 从松弛操作出发,比较 Bellman-Ford、Dijkstra 与 Floyd 的适用条件,并分析限制中转次数的最短路问题。 2021-11-30 算法笔记 > 图论 #LeetCode #最短路径 #Bellman-Ford #Dijkstra #Floyd
算法的时间复杂度分析 最初发布于 CSDN 这是对原有公开文章的首版整理,主要记录渐近阶、和式估计、递归树、主定理与 Akra-Bazzi 定理。原文可在 CSDN 阅读。 2021-11-25 算法笔记 > 算法分析 #算法 #时间复杂度 #主定理