๐Ÿ“ Empower Vision Applications with LoRA LMM - Eurosys'25

December 15, 2025

๐Ÿ“ Elastic On-Device LLM Service - MobiCom '25

December 8, 2025

๐Ÿ“ RServe: Overlapping Encoding and Prefill for Efficient LMM Inference

December 6, 2025

๐Ÿ“ Jupiter: Fast and Resource-Efficient Collaborative Inference of Generative LLMs on Edge Devices - INFOCOM'25

November 26, 2025

๐Ÿ“ Efficiently Serving Large Multimodal Models Using EPD Disaggregation - ICML'25

November 15, 2025

๐Ÿ“ ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism - NeurIPS'25 Oral

November 13, 2025