#machine learning
Dec 2025
SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification
To further accelerate speculative decoding in long-context generation, SpecPV is introduced, a self-speculative decoding approach that performs fast verification using partial key-value states (KV) and periodically applies full verification to eliminate accumulated errors.
Zhendong Tan, Xingjun Zhang, Chao-Yi Hu et al.
· arXiv.org · 7 citations