Story
triton_releases · Jul 29, 2026 · release
github.comJul 29, 2026
original source linked
Release highlights
- Added a streaming tool-call parse buffer limit to the OpenAI-compatible frontend to prevent excessive memory usage during streaming tool calls
- PyTorch backend: Enabled PyTorch 2 batching and added support for loading NV embedding layers
- Added an HSTU generative-recommender tutorial using the PyTorch AOTI serving path
Feed lens
agent
Continue reading