π DOCPRUNE: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning - CVPR'26
π PRUNE REDUNDANCY, PRESERVE ESSENCE: VISION TOKEN COMPRESSION IN VLMS VIA SYNERGISTIC IMPORTANCEβDIVERSITY - ICLR'26
π ONE PATCH DOESNβT FIT ALL: ADAPTIVE PATCHING FOR NATIVE-RESOLUTION MULTIMODAL LARGE LANGUAGE MODELS - ICLR'26
π Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models - EMNLP'25
π SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism - ICLR'26
π Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding - INFOCOM'26
π ModServe - Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving - SoCC'25
π Speculate Deep and Accurate - Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding - NeurIPS'25
π Jupiter: Fast and Resource-Efficient Collaborative Inference of Generative LLMs on Edge Devices - INFOCOM'25
π SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications - NeurIPS'25 Spotlight
π Breaking the Wall: Unifying Edge GPUs and NPUs into Pipeline Parallelism for Efficient LLM Fine-Tuning
π TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN FERENCE ON BATTERY-POWERED SMALL DEVICES - ICLR'26
π ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism - NeurIPS'25 Oral
π ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference - NeurIPS'25
π Stop Looking for βImportant Tokensβ in Multimodal Language Models: Duplication Matters More - EMNLP'25
π Efficient Multi-modal Large Language Models via Progressive Consistency Distillation - NeurIPS'25
π Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference - NeurIPS'25
π NOT ALL HEADS MATTER: A HEAD-LEVEL KV CACHE COMPRESSION METHOD WITH INTEGRATED RETRIEVAL AND REASONING - ICLR'25
π QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models - NeurIPS'25 Spotlight
π SPECVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning - EMNLP'25
π AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders - NeurIPS'25 Spotlight
π Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs - *NeurIPS'25