NiceOffer

面试面经 · 通用

【大模型】【推理优化工程师】【面经】(KV Cache+量化+部署)

大模型推理优化LLM面经综合

【大模型】【推理优化工程师】【面经】

基本信息

项目内容
公司多家公司通用
岗位大模型推理优化工程师
轮次综合
面型体感深度技术面,推理优化专项
面试官风格深入底层原理

面试题目

推理加速

  1. KV Cache 是什么?为什么能加速?代价是什么?
  2. Flash Attention 的原理?怎么把显存复杂度从 O(n²) 降到 O(n)?
  3. 解码策略:Greedy、Beam Search、Sampling 的区别?
  4. Temperature、Top-k、Top-p 各自的作用?
  5. Speculative Decoding(投机解码)了解吗?

模型量化

  1. 模型量化的目的?PTQ 和 QAT 的区别?
  2. INT8 量化的流程?校准数据集怎么选?
  3. GPTQ、AWQ、SmoothQuant 了解吗?
  4. 量化后精度损失怎么处理?

部署优化

  1. vLLM 的核心技术?PagedAttention 是什么?
  2. TensorRT-LLM 了解吗?
  3. 多卡推理怎么做?模型并行策略?
  4. Batch 推理怎么优化?Continuous Batching?

系统设计

  1. 设计一个高并发的 LLM 推理服务
  2. 如何在有限显存下服务 70B 模型?

准备建议

  • KV Cache 和 Flash Attention 是必考
  • 量化方法要能讲清原理和差异
  • vLLM、TensorRT 等部署框架要熟悉
  • 准备大规模推理系统设计题