Skip to main navigation Skip to search Skip to main content

Adaptive Inference for Medical Vision Transformers: Token Reduction or Early Exit?

Research output: Contribution to journalConference articlepeer-review

Abstract

Vision Transformers (ViTs) have demonstrated exceptional performance in medical image analysis, yet their computational demands hinder clinical deployment, particularly in time-sensitive applications. Medical imaging requires sample-adaptive optimization due to dataset heterogeneity across modalities and sample complexity; uniform strategies do not well balance efficiency and accuracy. We propose a unified adaptive inference framework that combines Token Reduction (TR) and Early Exiting (EE) through dataset-specific profiling. Our approach quantifies spatial redundancy via Jensen-Shannon Divergence (JSD) and prediction confidence at intermediate layers to train a lightweight predictor that dynamically selects inference strategies at test time. Across five medical datasets, including a real-world cataract dataset (INSIGHT), our framework achieves 71.4% average floating-point operations (FLOPs) reduction with only 0.1pp accuracy loss, substantially outperforming individual strategies (EE-only: 55.9%, TR-only: 57.7%). On PathMNIST, our adaptive inference framework simultaneously improves accuracy by 1.3pp while reducing computation by 77.2%. On INSIGHT, we maintain baseline accuracy with 69.8% FLOPs reduction, demonstrating robust real-world clinical applicability.

Original languageEnglish (US)
Pages (from-to)2171-2191
Number of pages21
JournalProceedings of Machine Learning Research
Volume315
StatePublished - 2026
Event9th International Conference on Medical Imaging with Deep Learning, MIDL 2026 - Chientan, Taiwan, Province of China
Duration: Jul 8 2026Jul 10 2026

Keywords

  • Early Exiting
  • Efficient Inference
  • Token Reduction
  • Vision Transformers

ASJC Scopus subject areas

  • Software
  • Control and Systems Engineering
  • Statistics and Probability
  • Artificial Intelligence

Fingerprint

Dive into the research topics of 'Adaptive Inference for Medical Vision Transformers: Token Reduction or Early Exit?'. Together they form a unique fingerprint.

Cite this