Story
arxiv_cs_ai ยท May 19, 2026 ยท paper
arxiv.orgMay 19, 2026
original source linked
In brief
Speculative decoding (SD) accelerates large language model inference by leveraging a draft-then-verify paradigm. To maximize the acceptance rate, recent methods construct expansive draft trees, which unfortunately inc...
Continue reading