NiceOffer

面试面经 · 阿里巴巴

【阿里云】【AI平台算法】【面经】(Transformer深度+分布式训练+ZeRO)

阿里云AI平台算法大模型面经综合

【阿里云】【AI平台算法】【面经】

基本信息

项目内容
公司阿里云
岗位AI 平台算法工程师
轮次综合
面型体感深度技术面,数学推导+显存计算
面试官风格深度追问,考察原理

面试题目

Transformer 深度考察

  1. RoPE(旋转位置编码)的数学原理?用复数域怎么解释?
  2. 为什么 RoPE 比绝对位置编码更适合长文本?
  3. NTK-Aware Scaling 是怎么解决高频信息丢失的?
  4. RMSNorm 和 LayerNorm 的计算差异?去掉均值为什么不影响收敛?
  5. Pre-Norm vs Post-Norm 的区别?为什么大模型用 Pre-Norm?
  6. SwiGLU 的参数量怎么计算?和标准 FFN 的差异?
  7. GQA、MQA、MHA 的区别?推理优化为什么选 GQA?
  8. 如何将 MHA 模型转换为 GQA 模型?

分布式训练

  1. ZeRO Stage 1/2/3 的区别?
  2. 手算题:训练一个 X 参数量模型,用 Adam 优化器,混合精度训练,显存占用多少?
  3. DeepSpeed 的三个显存优化方案是什么?

推理优化

  1. KV Cache 的显存占用怎么计算?
  2. Flash Attention 的分块计算原理?
  3. 量化方法:GPTQ、AWQ 的原理?

面试感受 / 反馈

阿里云考察深度极高,需要能进行数学推导和手算。RoPE 的复数域旋转、ZeRO 的显存分析是难点。能回答到这一层的候选人通常有实际调优经验。

准备建议

  • Transformer 要能推导数学公式
  • 显存计算要能手算
  • 分布式训练框架要深入理解
  • 准备实际项目中的优化经验