面试面经 · 百度
【百度】【大模型工程师】一面,深挖模型推理优化 + 量化部署 + 算法题,硬核技术面
【百度】大模型工程师 一面
基本信息
| 项目 | 内容 |
|---|---|
| 公司 | 百度 |
| 岗位 | 大模型工程师 |
| 轮次 | 一面(技术面) |
| 时间 | 2025 |
| 面型体感 | 硬核技术面,面试官深挖部署细节,纯理论回答不够 |
| 结果 | 通过 |
面试题目(按提问顺序)
第一部分:大模型推理优化(约 20 min)
- 推理框架与加速技术
- "vLLM 的核心原理是什么?PagedAttention 解决了什么问题?"
- "FlashAttention 和标准 Attention 的区别是什么?为什么 FlashAttention 能加速?"
- "KV Cache 的机制是什么?它在推理中起什么作用?占用多少显存?"
- "Speculative Decoding(投机解码)的原理是什么?什么场景下有效?"
- 量化与压缩
- "模型量化有哪些方案?PTQ 和 QAT 的区别是什么?"
- "AWQ、GPTQ、SmoothQuant 这几个量化方案各自的特点和适用场景?"
- "INT8 量化和 INT4 量化对模型效果的影响分别有多大?你们实测过吗?"
- "量化后怎么评估模型质量损失?用什么指标?"
第二部分:分布式推理与服务化(约 15 min)
- 分布式部署
- "70B 参数的模型单卡放得下吗?放不下的话怎么做 Tensor Parallel?"
- "TP 和 PP 的区别是什么?什么场景用 TP,什么场景用 PP?"
- "DeepSpeed-Inference 和 vLLM 各自的优缺点是什么?"
- 服务化部署
- "如果线上要求首 Token 延迟 < 500ms,你会怎么优化?"
- "如何处理 LLM 服务的高并发请求?Continuous Batching 的原理是什么?"
- "Cascading Model Architecture(级联模型架构)了解吗?小模型处理简单请求、大模型处理复杂请求的设计思路是什么?"
第三部分:大模型基础知识(约 10 min)
- Transformer 与注意力机制
- "Transformer 的注意力计算复杂度是多少?为什么是 O(n²)?有哪些降低复杂度的方案?"
- "GQA(Grouped Query Attention)和 MQA(Multi-Query Attention)了解吗?"
- 微调与对齐
- "RLHF 的完整流程是什么?Reward Model 怎么训练?PPO 的核心思路?"
- "DPO 和 RLHF 的区别是什么?DPO 有什么优势?"
第四部分:手撕算法(约 20 min)
- 算法题:实现 Tokenizer 的核心逻辑
- 给定一个词表和一个文本,实现 BPE(Byte Pair Encoding)的解码过程。
- 考察对分词器原理的理解 + 代码实现能力。
- 算法题:Top-K 问题
- 给定一个大小为 N 的数组和一个整数 K,返回数组中最大的 K 个元素。
- Min-Heap 或 Quick Select 解法,要求分析时间复杂度。
面试感受 / 反馈
- 百度的大模型工程岗非常 偏工程落地,不是纯算法/研究岗
- 面试官会追问"你们线上实测数据是多少",空谈理论不够
- 推理优化(vLLM、量化、KV Cache)是核心考察点,这部分要准备得很扎实
- 算法题不算特别难,但和 LLM 工程场景结合(Tokenizer、文本处理)
- 整体面试节奏快,每个模块时间分配紧凑
准备建议
- 深入理解 vLLM、PagedAttention、FlashAttention 的原理,不能只看博客
- 量化方案(AWQ、GPTQ、SmoothQuant)要能说清原理和实测数据
- 了解分布式推理的基本概念:TP/PP、DeepSpeed、Megatron-LM
- 手撕代码保持熟练,特别是和 NLP/Tokenizer 相关的实现
- 提前准备"你做过哪些模型部署/优化项目"的具体数据
反问示例
- "团队目前用的是自研模型还是开源模型?部署框架是 vLLM 还是自研的?"
- "模型推理的 QPS 和首 Token 延迟目标大概是多少?"