Story
arxiv_cs_lg ยท Aug 31, 2026 ยท paper
arxiv.orgAug 31, 2026
original source linked
In brief
Modern large language model (LLM) serving systems increasingly operate over repeated or shared context, yet each model typically performs its own prefill computation even when another model has already processed the s...
Feed lens
agenteval