Member of Technical Staff - Efficient ML
Embedding Vc · San Francisco, CA
View and Apply ↗
Opens the original job posting in a new tab.
Job description
Introducing Moonlake, AI for creating world simulations. SCOPE OF WORK Training efficiency - Dataloaders, fusion, activation remat, gradient checkpointing. - FSDP/ZeRO/tensor+pipeline parallel; NCCL tuning. GPU + kernel performance - Nsight profiling, Triton/CUDA kernels, fused ops. - Flash-attention–style speedups, sequence packing, KV-cache tricks.
Inference optimization - Low-latency serving, continuous batching, speculative decoding. - Quantization (GPTQ/AWQ), distillation, pruning. Infra + reliability - SLURM/K8s multi-node jobs, checkpoint hygiene. - Determinism, env pinning, GPU failure handling. We are committed to being an on-site, in-person team currently based in San Mateo