NiceOffer

面试面经 · 通用

【大模型】【微调工程师】【面经】(SFT+LoRA+RLHF+数据工程)

大模型微调SFTRLHF面经综合

【大模型】【微调工程师】【面经】

基本信息

项目内容
公司多家公司通用
岗位大模型微调工程师
轮次综合
面型体感技术面,微调专项
面试官风格考察数据和训练能力

面试题目

数据工程

  1. SFT 数据集怎么构建?
  2. 数据清洗怎么做?去重、质量筛选
  3. 数据配比对模型效果的影响?
  4. 合成数据怎么生成?质量怎么评估?
  5. 数据量多少合适?

微调方法

  1. 全参微调和 LoRA 的区别?
  2. LoRA 的原理?低秩矩阵怎么设计?
  3. QLoRA 怎么实现?4bit 量化的细节?
  4. 什么场景选全参微调,什么场景选 LoRA?

RLHF/DPO

  1. RLHF 的流程?奖励模型怎么训练?
  2. PPO 的原理?为什么用 PPO?
  3. DPO 和 RLHF 的区别?DPO 为什么更稳定?
  4. GRPO 了解吗?和 PPO 的区别?

评估和优化

  1. 微调后怎么评估效果?
  2. 微调后还会幻觉吗?怎么处理?
  3. 过拟合怎么避免?
  4. OOM 问题怎么处理?

准备建议

  • 数据工程要有实际经验
  • LoRA/QLoRA 要能讲清原理
  • RLHF/DPO 流程要清晰
  • 准备微调项目的实际案例