面试面经 · 通用
【大模型】【推理优化工程师】【面经】(KV Cache+量化+部署)
【大模型】【推理优化工程师】【面经】
基本信息
| 项目 | 内容 |
|---|---|
| 公司 | 多家公司通用 |
| 岗位 | 大模型推理优化工程师 |
| 轮次 | 综合 |
| 面型体感 | 深度技术面,推理优化专项 |
| 面试官风格 | 深入底层原理 |
面试题目
推理加速
- KV Cache 是什么?为什么能加速?代价是什么?
- Flash Attention 的原理?怎么把显存复杂度从 O(n²) 降到 O(n)?
- 解码策略:Greedy、Beam Search、Sampling 的区别?
- Temperature、Top-k、Top-p 各自的作用?
- Speculative Decoding(投机解码)了解吗?
模型量化
- 模型量化的目的?PTQ 和 QAT 的区别?
- INT8 量化的流程?校准数据集怎么选?
- GPTQ、AWQ、SmoothQuant 了解吗?
- 量化后精度损失怎么处理?
部署优化
- vLLM 的核心技术?PagedAttention 是什么?
- TensorRT-LLM 了解吗?
- 多卡推理怎么做?模型并行策略?
- Batch 推理怎么优化?Continuous Batching?
系统设计
- 设计一个高并发的 LLM 推理服务
- 如何在有限显存下服务 70B 模型?
准备建议
- KV Cache 和 Flash Attention 是必考
- 量化方法要能讲清原理和差异
- vLLM、TensorRT 等部署框架要熟悉
- 准备大规模推理系统设计题