AI
Two arXiv papers examine efficiency of speculative decoding techniques
Hasan publishes inference engineering explainer on speculative decoding
2
Sep 15 4:45 PM
· 12d ago · 1 post · 1 source · development 2 of 2
Engineer Danial Hasan publishes an article explaining speculative decoding as part of an inference engineering series, detailing how the technique speeds LLM inference and when it saves time, with practical examples using open-source vLLM.
x.com
“Speculative decoding can reduce the time an AI assistant takes to finish an answer. A cheap proposer drafts several tokens, and the model serving the request checks them together.”
Danial Hasan
Jahyun Koo, Sunghyeon Woo, Jaeeun Kil, Jeongtae Lee, Sungjae Lee, Kyomin Jung, Minsub Kim Researchers Ilya Koziev, Leonid Sinev, Ivan Oseledets Researchers Danial Hasan Inference engineer
The whole story articles posts
the bright band is this development · numbered dots are the others · click one to jump
Peak 2 pieces in 3h at Sep 14, 11 PM; 3 pieces over 13 days (2 articles · 1 post)
Sep 14, 11 PM — 2 pieces · 2 articles — Newswires 2 Sep 15, 2 AM — quiet Sep 15, 5 AM — quiet Sep 15, 8 AM — quiet Sep 15, 11 AM — quiet Sep 15, 2 PM — 1 piece · 1 post — X 1 Sep 15, 5 PM — quiet Sep 15, 8 PM — quiet Sep 15, 11 PM — quiet Sep 16, 2 AM — quiet Sep 16, 5 AM — quiet Sep 16, 8 AM — quiet Sep 16, 11 AM — quiet Sep 16, 2 PM — quiet Sep 16, 5 PM — quiet Sep 16, 8 PM — quiet Sep 16, 11 PM — quiet Sep 17, 2 AM — quiet Sep 17, 5 AM — quiet Sep 17, 8 AM — quiet Sep 17, 11 AM — quiet Sep 17, 2 PM — quiet Sep 17, 5 PM — quiet Sep 17, 8 PM — quiet Sep 17, 11 PM — quiet Sep 18, 2 AM — quiet Sep 18, 5 AM — quiet Sep 18, 8 AM — quiet Sep 18, 11 AM — quiet Sep 18, 2 PM — quiet Sep 18, 5 PM — quiet Sep 18, 8 PM — quiet Sep 18, 11 PM — quiet Sep 19, 2 AM — quiet Sep 19, 5 AM — quiet Sep 19, 8 AM — quiet Sep 19, 11 AM — quiet Sep 19, 2 PM — quiet Sep 19, 5 PM — quiet Sep 19, 8 PM — quiet Sep 19, 11 PM — quiet Sep 20, 2 AM — quiet Sep 20, 5 AM — quiet Sep 20, 8 AM — quiet Sep 20, 11 AM — quiet Sep 20, 2 PM — quiet Sep 20, 5 PM — quiet Sep 20, 8 PM — quiet Sep 20, 11 PM — quiet Sep 21, 2 AM — quiet Sep 21, 5 AM — quiet Sep 21, 8 AM — quiet Sep 21, 11 AM — quiet Sep 21, 2 PM — quiet Sep 21, 5 PM — quiet Sep 21, 8 PM — quiet Sep 21, 11 PM — quiet Sep 22, 2 AM — quiet Sep 22, 5 AM — quiet Sep 22, 8 AM — quiet Sep 22, 11 AM — quiet Sep 22, 2 PM — quiet Sep 22, 5 PM — quiet Sep 22, 8 PM — quiet Sep 22, 11 PM — quiet Sep 23, 2 AM — quiet Sep 23, 5 AM — quiet Sep 23, 8 AM — quiet Sep 23, 11 AM — quiet Sep 23, 2 PM — quiet Sep 23, 5 PM — quiet Sep 23, 8 PM — quiet Sep 23, 11 PM — quiet Sep 24, 2 AM — quiet Sep 24, 5 AM — quiet Sep 24, 8 AM — quiet Sep 24, 11 AM — quiet Sep 24, 2 PM — quiet Sep 24, 5 PM — quiet Sep 24, 8 PM — quiet Sep 24, 11 PM — quiet Sep 25, 2 AM — quiet Sep 25, 5 AM — quiet Sep 25, 8 AM — quiet Sep 25, 11 AM — quiet Sep 25, 2 PM — quiet Sep 25, 5 PM — quiet Sep 25, 8 PM — quiet Sep 25, 11 PM — quiet Yesterday, 2 AM — quiet Yesterday, 5 AM — quiet Yesterday, 8 AM — quiet Yesterday, 11 AM — quiet Yesterday, 2 PM — quiet Yesterday, 5 PM — quiet Yesterday, 8 PM — quiet Yesterday, 11 PM — quiet Today, 2 AM — quiet Today, 5 AM — quiet Today, 8 AM — quiet Today, 11 AM — quiet Today, 2 PM — quiet Today, 5 PM — quiet Today, 8 PM — quiet
1 2
Sep 15 Sep 16 Sep 17 Sep 18 Sep 19 Sep 20 Sep 21 Sep 22 Sep 23 Sep 24 Sep 25 yesterday now · 11:44 PM ET
What people said 1 voice · verbatim
@
article 3 of my inference engineering series - diving into 1 of the 4 major techniques, speculative decoding! this technique speeds up LLM inference by using a smaller, faster model to draft tokens that the larger model verifies in parallel.
All 2 developments of Two arXiv papers examine efficiency of speculative decoding… →
Newswires X