πŸ“ KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows

June 20, 2026

πŸ“ ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System - ICML'26 Spotlight

June 18, 2026

πŸ“ EPIC: Efficient Position-Independent Caching for Serving Large Language Models - ICML'25

June 5, 2026

πŸ“ VLCACHE: Computing 2% Vision Tokens and Reusing 98% for Vision–Language Inference

January 6, 2026

πŸ“ KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction - NeuIPS'25 Oral

November 21, 2025

πŸ“ ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference - NeurIPS'25

November 12, 2025

πŸ“ HEADINFER: Memory-Efficient LLM Inference by Head-wise Offloading

November 9, 2025

πŸ“ Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference - NeurIPS'25

November 1, 2025

πŸ“ NOT ALL HEADS MATTER: A HEAD-LEVEL KV CACHE COMPRESSION METHOD WITH INTEGRATED RETRIEVAL AND REASONING - ICLR'25

October 31, 2025

πŸ“ QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models - NeurIPS'25 Spotlight

October 30, 2025

πŸ“ R-KV: Redundancy-aware KV Cache Compression for Reasoning Models - NeurIPS'25

October 25, 2025

πŸ“ Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs - *NeurIPS'25

October 24, 2025

πŸ“ Cache-to-Cache: Direct Semantic Communication Between Large Language Models - ICLR'26

October 15, 2025