大模型术语

RAG

  1. RAG(Retrieval-Augmented Generation,检索增强生成)的核心思想是:让大模型不再“只靠记忆说话”,而是“先查资料再回答”。它通过把外部知识库的检索结果动态注入到模型的上下文中,大幅提升回答的准确性、时效性和可解释性.
  2. RAG = 检索(Retrieve) + 增强(Augment) + 生成(Generate)
    模型在回答前会从知识库中检索相关内容,把这些内容作为上下文输入,再由大模型生成最终答案。

RLHF

  1. RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)的核心思想是:让大模型先学会基本能力, 再通过人类反馈告诉它什么是“好回答”, 最后用强化学习逼它朝这个方向优化.是让大模型“更像人、更可控、更安全”的关键技术.
  2. RLHF = 监督微调(SFT) + 奖励模型(RM) + 强化学习(PPO)它让模型从“会说话”变成“说得好、说得安全、说得符合人类偏好”

RLHF 的流程

  1. 监督微调(SFT) 用人工写的高质量示范数据,让模型学会“基本的好回答方式”.

人类写示范回答

模型模仿这些回答

目标:让模型具备“基础对话能力”

  1. 奖励模型(Reward Model, RM)训练
    让模型学会“什么是更好的回答”.

人类对多个回答进行排序(如 A 比 B 好)

用这些排序训练一个奖励模型

奖励模型能给任意回答打分

奖励模型的作用: 它是模型的“审稿人”和“评分器”.

  1. 强化学习(PPO)优化主模型
    让模型在奖励模型的评分下不断改进.

模型生成回答

奖励模型打分

用 PPO(Proximal Policy Optimization)优化模型

目标:让模型输出更符合人类偏好的回答

最终效果: 模型会自动倾向于“礼貌、安全、逻辑清晰、符合人类价值”的回答.

CoT 和 ToT

提示词工程

提示词六要素: 角色, 任务, 背景/上下文, 输入数据, 输出格式, 质量与约束.