NiceOffer

面试面经 · 百度

【百度】【大模型工程师】一面,深挖模型推理优化 + 量化部署 + 算法题,硬核技术面

百度大模型工程师社招面经一面

【百度】大模型工程师 一面

基本信息

项目内容
公司百度
岗位大模型工程师
轮次一面(技术面)
时间2025
面型体感硬核技术面,面试官深挖部署细节,纯理论回答不够
结果通过

面试题目(按提问顺序)

第一部分:大模型推理优化(约 20 min)

  1. 推理框架与加速技术
  • "vLLM 的核心原理是什么?PagedAttention 解决了什么问题?"
  • "FlashAttention 和标准 Attention 的区别是什么?为什么 FlashAttention 能加速?"
  • "KV Cache 的机制是什么?它在推理中起什么作用?占用多少显存?"
  • "Speculative Decoding(投机解码)的原理是什么?什么场景下有效?"
  1. 量化与压缩
  • "模型量化有哪些方案?PTQ 和 QAT 的区别是什么?"
  • "AWQ、GPTQ、SmoothQuant 这几个量化方案各自的特点和适用场景?"
  • "INT8 量化和 INT4 量化对模型效果的影响分别有多大?你们实测过吗?"
  • "量化后怎么评估模型质量损失?用什么指标?"

第二部分:分布式推理与服务化(约 15 min)

  1. 分布式部署
  • "70B 参数的模型单卡放得下吗?放不下的话怎么做 Tensor Parallel?"
  • "TP 和 PP 的区别是什么?什么场景用 TP,什么场景用 PP?"
  • "DeepSpeed-Inference 和 vLLM 各自的优缺点是什么?"
  1. 服务化部署
  • "如果线上要求首 Token 延迟 < 500ms,你会怎么优化?"
  • "如何处理 LLM 服务的高并发请求?Continuous Batching 的原理是什么?"
  • "Cascading Model Architecture(级联模型架构)了解吗?小模型处理简单请求、大模型处理复杂请求的设计思路是什么?"

第三部分:大模型基础知识(约 10 min)

  1. Transformer 与注意力机制
  • "Transformer 的注意力计算复杂度是多少?为什么是 O(n²)?有哪些降低复杂度的方案?"
  • "GQA(Grouped Query Attention)和 MQA(Multi-Query Attention)了解吗?"
  1. 微调与对齐
  • "RLHF 的完整流程是什么?Reward Model 怎么训练?PPO 的核心思路?"
  • "DPO 和 RLHF 的区别是什么?DPO 有什么优势?"

第四部分:手撕算法(约 20 min)

  1. 算法题:实现 Tokenizer 的核心逻辑
  • 给定一个词表和一个文本,实现 BPE(Byte Pair Encoding)的解码过程。
  • 考察对分词器原理的理解 + 代码实现能力。
  1. 算法题:Top-K 问题
  • 给定一个大小为 N 的数组和一个整数 K,返回数组中最大的 K 个元素。
  • Min-Heap 或 Quick Select 解法,要求分析时间复杂度。

面试感受 / 反馈

  • 百度的大模型工程岗非常 偏工程落地,不是纯算法/研究岗
  • 面试官会追问"你们线上实测数据是多少",空谈理论不够
  • 推理优化(vLLM、量化、KV Cache)是核心考察点,这部分要准备得很扎实
  • 算法题不算特别难,但和 LLM 工程场景结合(Tokenizer、文本处理)
  • 整体面试节奏快,每个模块时间分配紧凑

准备建议

  • 深入理解 vLLM、PagedAttention、FlashAttention 的原理,不能只看博客
  • 量化方案(AWQ、GPTQ、SmoothQuant)要能说清原理和实测数据
  • 了解分布式推理的基本概念:TP/PP、DeepSpeed、Megatron-LM
  • 手撕代码保持熟练,特别是和 NLP/Tokenizer 相关的实现
  • 提前准备"你做过哪些模型部署/优化项目"的具体数据

反问示例

  • "团队目前用的是自研模型还是开源模型?部署框架是 vLLM 还是自研的?"
  • "模型推理的 QPS 和首 Token 延迟目标大概是多少?"