Skip to content

申晗

Member of Technical Staff,Moonshot AI

关于

你好 👋 我在 Moonshot AI 做 AI 基础设施——大模型推理、RL 基础设施、深度学习编译器、GPU 性能优化。工作大多落在模型与硬件之间:让大模型服务成本降下来,也让这笔成本在部署之前就能算得准。

来 Moonshot 之前,我在快手负责 LLM 推理与 AI 编译团队,工作横跨大模型推理系统与面向推荐场景的编译器。更早在趋动科技搭建并领导 AI framework 团队,做 GPU 虚拟化;再往前在地平线机器人做计算机视觉,在 Cisco Systems(San Jose)做网络软件。清华大学计算机科学与技术硕士、电子工程系工学学士。

最近在做 HuggingArch,一套让推理算账自动化、可验证的 harness。

近期动态

  • 2026.08 —— 发布 HuggingArch:给一个 HuggingFace 上开源的模型,自动推导出经过校验的架构 spec,再在上面算 KV cache、并行切分与推理吞吐。
  • 2026.07 —— Kimi K3 发布 —— 技术报告
  • 2026.06 —— 加入 Moonshot AI,Member of Technical Staff。
  • 2025.09 —— 上线 PaperCache,用 LLM 做论文精读而非摘要的博客——背后的设计原则
  • 2025.03 —— 在 GTC 2025 讲 AI 编译器(S72642);发布 DeepSeek 推理效率分析系列,率先在业内证明了 DeepSeek 在 H800/H20 上的部署上限。
  • 2024.12 —— 写了 GPU 降频PCIE 上的 GPU D2D 拷贝
  • 2024 —— 在 DataFun Summit 2024 分享推搜广计算引擎优化实践。

精选写作

  • DeepSeek V3/R1 推理效率分析(三篇)—— 只靠论文估出的吞吐上限、对官方 EP144 部署的逐层逆向工程、以及把结论泛化到不同设备数与硬件的模拟器
  • GPU 降频 —— 大矩阵 GEMM 为什么永远跑不到标称算力,在 T4、A10、A800、H800 上实测
  • PCIE 上的 GPU D2D 拷贝 —— 从 cudaMemcpyAsync 到自定义向量化 kernel,并与 NCCL 对比

全部文章见博客

项目

  • HuggingArch —— 让 LLM 推理算账自动、可验证、可复用的 harness。
  • PaperCache —— 用 LLM 做论文精读的博客,覆盖机器学习系统、大模型与 AI 加速器。
  • DeepSeek_Simulator —— 基于 DeepGEMM、FlashMLA 与 torch 的 decode 配置模拟器。

技术讲座


欢迎来信 —— [email protected]

Powered by VitePress