πŸ“ LEARNPRUNER: RETHINKING ATTENTION-BASED TOKEN PRUNING IN VISION LANGUAGE MODELS - ICLR'26

May 9, 2026

πŸ“ DOCPRUNE: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning - CVPR'26

April 29, 2026

πŸ“ Empirical Recipes for Efficient and Compact Vision-Language Models

March 24, 2026

πŸ“ Variation-aware Vision Token Dropping for Faster Large Vision-Language Models - CVPR'26

March 23, 2026

πŸ“ PRUNE REDUNDANCY, PRESERVE ESSENCE: VISION TOKEN COMPRESSION IN VLMS VIA SYNERGISTIC IMPORTANCE–DIVERSITY - ICLR'26

March 1, 2026

πŸ“ MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs - ICLR'26

February 28, 2026

πŸ“ ONE PATCH DOESN’T FIT ALL: ADAPTIVE PATCHING FOR NATIVE-RESOLUTION MULTIMODAL LARGE LANGUAGE MODELS - ICLR'26

February 2, 2026

πŸ“ Matryoshka Multimodal Models - ICLR'25

January 30, 2026

πŸ“ Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models - EMNLP'25

January 22, 2026

πŸ“ VLCACHE: Computing 2% Vision Tokens and Reusing 98% for Vision–Language Inference

January 6, 2026

πŸ“ Accelerating Streaming Video Large Language Models via Hierarchical Token Compression - CVPR'26

December 27, 2025

πŸ“ HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices

December 23, 2025

πŸ“ VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning - NeurIPS'25

December 21, 2025

πŸ“ Empower Vision Applications with LoRA LMM - Eurosys'25

December 15, 2025

πŸ“ Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding - INFOCOM'26

December 12, 2025

πŸ“ RServe: Overlapping Encoding and Prefill for Efficient LMM Inference

December 6, 2025

πŸ“ ModServe - Modality- and Stage-Aware Resource Disaggregation for Scalable Multimodal Model Serving - SoCC'25

November 27, 2025

πŸ“ Efficiently Serving Large Multimodal Models Using EPD Disaggregation - ICML'25

November 15, 2025

πŸ“ ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism - NeurIPS'25 Oral

November 13, 2025

πŸ“ Stop Looking for β€œImportant Tokens” in Multimodal Language Models: Duplication Matters More - EMNLP'25

November 12, 2025

πŸ“ MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders -CVPR 2025

November 10, 2025

πŸ“ Efficient Multi-modal Large Language Models via Progressive Consistency Distillation - NeurIPS'25

November 7, 2025

πŸ“ ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding - NeurIPS'25

November 5, 2025

πŸ“ QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models - NeurIPS'25 Spotlight

October 30, 2025

πŸ“ SPECVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning - EMNLP'25

October 29, 2025

πŸ“ Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs - *NeurIPS'25

October 24, 2025