LLM 系统 · 高效推理 · 算力分配

Jingbo Wen (Tony)

我研究并构建大语言模型的基础设施:推理服务、投机解码与分布式训练。

目前在悉尼大学攻读软件工程荣誉学士学位。最近在微软担任 Applied Scientist 实习生,做基础模型的推理服务;此前在小红书担任 Agent 工程实习生。

正在寻找 LLM 工程 / LLM 基础设施方向的职位。

足迹

拖动旋转地球 · 点选地点即可飞过去

研究方向是推理算力的分配:后果感知的推理预算与视觉 token 压缩、预算鲁棒的投机解码、面向智能体的回报感知执行门控,以及跨推理服务商的市场感知路由。

  1. Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation

    Liang He, Jingbo Wen, Haoyu Wang, Ziqi He, Yixiong Chen, Kangning Cui, Xilu Wang

    预印本 · arXiv:2606.04402 [cs.AI] · 2026.06

    在 SWE-bench Lite 上,相比按难度分配算力的路由,代价加权损失降低 22–33%。

  2. BudgetDraft: Acceptance-Aware Multi-View Training for Sparse-KV Speculative Decoding

    Liang He, Jingbo Wen, Qishi Zhan, Yixiong Chen, Kangning Cui, Qizhen Lan, Xilu Wang

    预印本 · arXiv:2606.00144 [cs.LG] · 2026.05

    一个对预算鲁棒的 drafter 即可适配稀疏 KV Cache;4K 上下文下端到端加速 6.55×。

  3. Not All Visual Tokens Are Equally Safe to Remove: Consequence-Sensitive Visual Token Compression

    Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

    预印本 · arXiv:2608.09176 [cs.CV] · 2026.08

    在固定 token 预算下,高风险 VLM 错误率由 0.300 降至 0.133;代价加权错误降低 38%。

  4. From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

    Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang

    预印本 · arXiv:2608.09168 [cs.AI] · 2026.08

    RADEG 跳过 68% 的 agent 调用,同时保留 61% 的总回报。

  5. You Cannot Pick a Provider From the Price List: Market-Aware Routing for Open-Weight LLM Inference

    Liang He, Jingbo Wen, Yixiong Chen, Yue Yang, Qizhen Lan, Kangning Cui, Xilu Wang

    预印本 · arXiv:2609.37902 [cs.AI] · 2026.09

    价格并不能预测质量;基于实测的路由在同等质量下节省 约 50% 的成本。

微软 Microsoft

Applied Scientist 实习生Azure community infra

  • 用 Go 为基础模型(Foundation Model)推理服务构建动态批处理请求调度器(路由、准入控制、截止时间),支撑 2K+ 并发流;突发流量下 p99 TTFT 降低 28%。
  • 将 EAGLE-3 投机解码集成进服务运行时,并实现按请求的 KV-cache 回滚,使接受长度不一的批次可在一次前向中完成验证;平均接受长度 3.6 时 tokens/s 达 1.8×。
  • 用 pprof 与 Nsight Systems 剖析调度器到 GPU 的链路;定位到 TPOT 退化源于逐 token 的调度器–运行时 RPC 开销,并以批量流式传输消除,TPOT 降低 17%。
  • 搭建覆盖不同批大小与投机配置的基准测试与可观测性体系,监测 TTFT、TPOT、tokens/s 与 KV-cache 占用;其负载扫描结果确定了超过即停用投机解码的并发阈值。

小红书 Xiaohongshu

Agent 工程实习生Social Networking Engineering

  • 从 0 到 1 设计并开发内部 Coding Agent,可根据自然语言指令自主完成代码库理解、多文件编辑、工具调用、代码执行与迭代调试。
  • 为线上移动应用从 0 到 1 搭建 OCR 核验流水线(提取、校验、异常处理),并从原型推进到上线:核验准确率 98%,上线首日完成 21K+ 用户核验。
  • 优化 LLM 推理服务(vLLM、INT4 量化、连续批处理):QPS +45%,成本 −40%。
  • 搭建并维护内部 LLM 训练与评测流水线,支持 SFT / DPO / RLHF 流程。

分布式 LLM 训练与推理系统

个人项目LLM 系统 / 分布式计算

  • 从零实现 350M–1.3B 参数的 GPT 风格 Transformer(GQA、RoPE、SwiGLU、RMSNorm)。
  • 实现 Megatron 风格的张量并行(Column/RowParallelLinear、VocabParallelEmbedding)与流水线并行(GPipe / 1F1B 调度、P2P 激活传输、pipeline bubble 分析)。
  • 将 DeepSpeed ZeRO-1/2/3 与 CPU Offload 集成进 3D 并行训练栈(TP × PP × DP),在 4×A100(TP=2,PP=2)上用 1.5B token 预训练 1.3B 模型。
  • 实现 KV Cache 推理引擎(Prefill/Decode 分离、动态批处理、每步 O(n) 注意力)。
  • 编写自定义 CUDA C++ 与 Triton kernel(逐元素融合、归约、softmax/LayerNorm、分块矩阵乘),并用 Nsight Compute 与 PyTorch 原生算子对比剖析。
LLM 训练
LoRA · SFT / DPO / RLHF · DDP · Tensor / Pipeline Parallelism · DeepSpeed ZeRO-1/2/3 · NCCL
LLM 推理
KV Cache · Paged Attention · Speculative Decoding · Quantization · vLLM · TensorRT-LLM
GPU 与 Kernel
CUDA C++ · Triton · Nsight Compute · CUDA Streams / Events
ML 工程
PyTorch · Go · FAISS · ChromaDB · RAG · FastAPI · Docker · Linux · Git

悉尼大学 University of Sydney

软件工程荣誉学士 · B.Eng. (Hons), Software Engineering (ECE)

  • GPA 3.8 / 4.0
  • 2025 Dean’s List
  • TOEFL iBT 110 / 120(5.5 / 6)

在掘金连载《拆解大模型》系列,讲大语言模型到底是怎么工作的:语言建模、Transformer 内部机制、Attention 与训练。

前往掘金阅读