SYNTOLOGY HomeExplorerAtlasCodeMethodologyAboutDevelopersFeedPricing
Paper · 2601.19278 · 2026

DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference

Zhibin Wang, Wanchun Dou, Xue Li, Sheng Zhong, Chen Tian, Fuliang Liu, Zhonghui Zhang, Ketai Zhao, Yinxi Gao, Ziyan Zhou

arXiv · PDF · Open in the Atlas

Code that ran

We lifted 15 functions out of this paper's own repositories and ran 6 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.

RepositoryRoleRan
fvliang/DART canonical 6 of 15
FunctionStatusWhere it lives
repeat_kv Ran fvliang/DART/dart/model/llama3_dart.py
code served (permissive licence) · get_code("3c76e52815c5401d")
apply_rotary_pos_emb Ran fvliang/DART/dart/model/modeling_mixtral_kv.py
code served (permissive licence) · get_code("d61c483a3c2b3156")
apply_rotary_pos_emb Ran fvliang/DART/dart/model/modeling_qwen3_kv.py
code served (permissive licence) · get_code("583539efd6fd01fb")
prepare_logits_processor Ran fvliang/DART/dart/model/dart_utils.py
code served (permissive licence) · get_code("78ae913ae6243c38")
rotate_half Ran fvliang/DART/dart/model/modeling_mixtral_kv.py
code served (permissive licence) · get_code("b99eea6376d1e212")
rotate_half Ran fvliang/DART/dart/model/llama3_dart.py
code served (permissive licence) · get_code("e03d53ba9d4f9ae5")
apply_rotary_pos_emb Not yet run fvliang/DART/dart/model/llama3_dart.py
code served (permissive licence) · get_code("a93e62ca7757414c")
apply_rotary_pos_emb Not yet run fvliang/DART/dart/model/modeling_llama_kv.py
code served (permissive licence) · get_code("eee34413e2bccab6")
apply_rotary_pos_emb_L31 Not yet run fvliang/DART/dart/model/modeling_llama_kv.py
code served (permissive licence) · get_code("484407b65b6e2d25")
initialize_past_key_values Not yet run fvliang/DART/dart/model/kv_cache.py
code served (permissive licence) · get_code("9315d4be39a16b19")
initialize_past_key_values_for_dart Not yet run fvliang/DART/dart/model/kv_cache.py
code served (permissive licence) · get_code("13acf4d3e45fcce4")
initialize_past_key_values_medusa Not yet run fvliang/DART/dart/model/kv_cache.py
code served (permissive licence) · get_code("0facd77438c97501")
load_balancing_loss_func Not yet run fvliang/DART/dart/model/modeling_mixtral_kv.py
code served (permissive licence) · get_code("d9308d9bf18cd072")
rotate_half Not yet run fvliang/DART/dart/model/modeling_llama_kv.py
code served (permissive licence) · get_code("ded2d9e57bfdee4e")
sequnce_cmp Not yet run fvliang/DART/dart/tree_search/tree_search.py
code served (permissive licence) · get_code("d209313465058d56")

Repositories linked to this paper

Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.

Abstract

Speculative decoding is an effective and lossless approach for accelerating LLM inference. However, existing widely adopted model-based draft designs, such as EAGLE3, improve accuracy at the cost of multi-step autoregressive inference, resulting in high drafting latency and ultimately rendering the drafting stage itself a performance bottleneck. Inspired by diffusion-based large language models (dLLMs), we propose DART, which leverages parallel generation to reduce drafting latency. DART predicts logits for multiple future masked positions in parallel within a single forward pass based on hidden states of the target model, thereby eliminating autoregressive rollouts in the draft model while preserving a lightweight design. Based on these parallel logit predictions, we further introduce an efficient tree pruning algorithm that constructs high-quality draft token trees with N-gram-enforced semantic continuity. DART substantially reduces draftstage overhead while preserving high draft accuracy, leading to significantly improved end-toend decoding speed. Experimental results demonstrate that DART achieves a 2.03×-3.44× wallclock time speedup across multiple datasets, surpassing EAGLE3 by 30% on average and offering a practical speculative decoding framework. Code is released at https://github.com/fvliang/DART.

For agents

The same record, over MCP at https://syntology.ai/mcp:

get_harvested_code_for_paper("2601.19278")
get_code_for_paper("2601.19278")
have("2601.19278")

Connect an agent — have() is free.