面试面经 · 阿里巴巴
【阿里云】【AI平台算法】【面经】(Transformer深度+分布式训练+ZeRO)
【阿里云】【AI平台算法】【面经】
基本信息
| 项目 | 内容 |
|---|---|
| 公司 | 阿里云 |
| 岗位 | AI 平台算法工程师 |
| 轮次 | 综合 |
| 面型体感 | 深度技术面,数学推导+显存计算 |
| 面试官风格 | 深度追问,考察原理 |
面试题目
Transformer 深度考察
- RoPE(旋转位置编码)的数学原理?用复数域怎么解释?
- 为什么 RoPE 比绝对位置编码更适合长文本?
- NTK-Aware Scaling 是怎么解决高频信息丢失的?
- RMSNorm 和 LayerNorm 的计算差异?去掉均值为什么不影响收敛?
- Pre-Norm vs Post-Norm 的区别?为什么大模型用 Pre-Norm?
- SwiGLU 的参数量怎么计算?和标准 FFN 的差异?
- GQA、MQA、MHA 的区别?推理优化为什么选 GQA?
- 如何将 MHA 模型转换为 GQA 模型?
分布式训练
- ZeRO Stage 1/2/3 的区别?
- 手算题:训练一个 X 参数量模型,用 Adam 优化器,混合精度训练,显存占用多少?
- DeepSpeed 的三个显存优化方案是什么?
推理优化
- KV Cache 的显存占用怎么计算?
- Flash Attention 的分块计算原理?
- 量化方法:GPTQ、AWQ 的原理?
面试感受 / 反馈
阿里云考察深度极高,需要能进行数学推导和手算。RoPE 的复数域旋转、ZeRO 的显存分析是难点。能回答到这一层的候选人通常有实际调优经验。
准备建议
- Transformer 要能推导数学公式
- 显存计算要能手算
- 分布式训练框架要深入理解
- 准备实际项目中的优化经验