申晗
Member of Technical Staff,Moonshot AI
邮箱·GitHub·Google Scholar·LinkedIn·知乎
关于
你好 👋 我在 Moonshot AI 做 AI 基础设施——大模型推理、RL 基础设施、深度学习编译器、GPU 性能优化。工作大多落在模型与硬件之间:让大模型服务成本降下来,也让这笔成本在部署之前就能算得准。
来 Moonshot 之前,我在快手负责 LLM 推理与 AI 编译团队,工作横跨大模型推理系统与面向推荐场景的编译器。更早在趋动科技搭建并领导 AI framework 团队,做 GPU 虚拟化;再往前在地平线机器人做计算机视觉,在 Cisco Systems(San Jose)做网络软件。清华大学计算机科学与技术硕士、电子工程系工学学士。
最近在做 HuggingArch,一套让推理算账自动化、可验证的 harness。
近期动态
- 2026.08 —— 发布 HuggingArch:给一个 HuggingFace 上开源的模型,自动推导出经过校验的架构 spec,再在上面算 KV cache、并行切分与推理吞吐。
- 2026.07 —— Kimi K3 发布 —— 技术报告。
- 2026.06 —— 加入 Moonshot AI,Member of Technical Staff。
- 2025.09 —— 上线 PaperCache,用 LLM 做论文精读而非摘要的博客——背后的设计原则。
- 2025.03 —— 在 GTC 2025 讲 AI 编译器(S72642);发布 DeepSeek 推理效率分析系列,率先在业内证明了 DeepSeek 在 H800/H20 上的部署上限。
- 2024.12 —— 写了 GPU 降频 与 PCIE 上的 GPU D2D 拷贝。
- 2024 —— 在 DataFun Summit 2024 分享推搜广计算引擎优化实践。
精选写作
- DeepSeek V3/R1 推理效率分析(三篇)—— 只靠论文估出的吞吐上限、对官方 EP144 部署的逐层逆向工程、以及把结论泛化到不同设备数与硬件的模拟器
- GPU 降频 —— 大矩阵 GEMM 为什么永远跑不到标称算力,在 T4、A10、A800、H800 上实测
- PCIE 上的 GPU D2D 拷贝 —— 从
cudaMemcpyAsync到自定义向量化 kernel,并与 NCCL 对比
全部文章见博客。
项目
- HuggingArch —— 让 LLM 推理算账自动、可验证、可复用的 harness。
- PaperCache —— 用 LLM 做论文精读的博客,覆盖机器学习系统、大模型与 AI 加速器。
- DeepSeek_Simulator —— 基于 DeepGEMM、FlashMLA 与 torch 的 decode 配置模拟器。
技术讲座
- Unlocking the Potential of the AI Compiler in Recommendation Systems [S72642] —— GTC 2025
- 快手推搜广计算引擎优化实践 —— DataFun Summit 2024
欢迎来信 —— [email protected]