大模型基础
大模型术语
RAG
- RAG(Retrieval-Augmented Generation,检索增强生成)的核心思想是:让大模型不再“只靠记忆说话”,而是“先查资料再回答”。它通过把外部知识库的检索结果动态注入到模型的上下文中,大幅提升回答的准确性、时效性和可解释性.
- RAG = 检索(Retrieve) + 增强(Augment) + 生成(Generate)
模型在回答前会从知识库中检索相关内容,把这些内容作为上下文输入,再由大模型生成最终答案。
RLHF
- RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)的核心思想是:让大模型先学会基本能力, 再通过人类反馈告诉它什么是“好回答”, 最后用强化学习逼它朝这个方向优化.是让大模型“更像人、更可控、更安全”的关键技术.
- RLHF = 监督微调(SFT) + 奖励模型(RM) + 强化学习(PPO)它让模型从“会说话”变成“说得好、说得安全、说得符合人类偏好”
RLHF 的流程
- 监督微调(SFT) 用人工写的高质量示范数据,让模型学会“基本的好回答方式”.
人类写示范回答
模型模仿这些回答
目标:让模型具备“基础对话能力”
- 奖励模型(Reward Model, RM)训练
让模型学会“什么是更好的回答”.
人类对多个回答进行排序(如 A 比 B 好)
用这些排序训练一个奖励模型
奖励模型能给任意回答打分
奖励模型的作用: 它是模型的“审稿人”和“评分器”.
- 强化学习(PPO)优化主模型
让模型在奖励模型的评分下不断改进.
模型生成回答
奖励模型打分
用 PPO(Proximal Policy Optimization)优化模型
目标:让模型输出更符合人类偏好的回答
最终效果: 模型会自动倾向于“礼貌、安全、逻辑清晰、符合人类价值”的回答.
CoT 和 ToT
提示词工程
提示词六要素: 角色, 任务, 背景/上下文, 输入数据, 输出格式, 质量与约束.