面试面经 · 通用
【大模型】【微调工程师】【面经】(SFT+LoRA+RLHF+数据工程)
【大模型】【微调工程师】【面经】
基本信息
| 项目 | 内容 |
|---|---|
| 公司 | 多家公司通用 |
| 岗位 | 大模型微调工程师 |
| 轮次 | 综合 |
| 面型体感 | 技术面,微调专项 |
| 面试官风格 | 考察数据和训练能力 |
面试题目
数据工程
- SFT 数据集怎么构建?
- 数据清洗怎么做?去重、质量筛选
- 数据配比对模型效果的影响?
- 合成数据怎么生成?质量怎么评估?
- 数据量多少合适?
微调方法
- 全参微调和 LoRA 的区别?
- LoRA 的原理?低秩矩阵怎么设计?
- QLoRA 怎么实现?4bit 量化的细节?
- 什么场景选全参微调,什么场景选 LoRA?
RLHF/DPO
- RLHF 的流程?奖励模型怎么训练?
- PPO 的原理?为什么用 PPO?
- DPO 和 RLHF 的区别?DPO 为什么更稳定?
- GRPO 了解吗?和 PPO 的区别?
评估和优化
- 微调后怎么评估效果?
- 微调后还会幻觉吗?怎么处理?
- 过拟合怎么避免?
- OOM 问题怎么处理?
准备建议
- 数据工程要有实际经验
- LoRA/QLoRA 要能讲清原理
- RLHF/DPO 流程要清晰
- 准备微调项目的实际案例