面试面经 · 腾讯
【腾讯】【大模型算法工程师】【一面】面经(Transformer+微调+RAG)
【腾讯】【大模型算法工程师】【一面】
基本信息
| 项目 | 内容 |
|---|---|
| 公司 | 腾讯 |
| 岗位 | 大模型算法工程师 |
| 轮次 | 一面 |
| 面型体感 | 技术面,LLM基础+项目 |
| 面试官风格 | 深入追问原理 |
| 结果 | 通过 |
面试题目(按提问顺序)
- Transformer 的核心结构是什么?
- Self-Attention 的计算公式?为什么要除以 √dk?
- 多头注意力(Multi-Head Attention)比单头好在哪里?
- 位置编码为什么需要?RoPE 的原理是什么?
- RMSNorm 和 LayerNorm 的区别?为什么大模型用 RMSNorm?
- SwiGLU 激活函数的参数量怎么计算?
- GQA、MQA、MHA 的区别?为什么推理优化用 GQA?
- SFT(监督微调)数据集怎么构建?
- RLHF 和 DPO 的区别?DPO 为什么更稳定?
- RAG 的整体流程是什么?
- 文档切片粒度怎么定?切大切小各有什么风险?
- 向量召回和 BM25 各自适合什么场景?
- 项目深挖:微调项目的业务背景、数据构成、评估方式
面试感受 / 反馈
腾讯大模型一面考察 LLM 基础知识,Transformer 架构是必考。面试官会深入追问数学原理,如 RoPE 的复数域旋转、RMSNorm 的计算差异。RAG 相关问题是热点。
准备建议
- Transformer 架构要能推导公式
- RoPE、RMSNorm、GQA 是 2025 热点
- SFT/RLHF/DPO 流程要清晰
- RAG 流程和优化要准备