Zhibin Wang, Wanchun Dou, Xue Li, Sheng Zhong, Chen Tian, Fuliang Liu, Zhonghui Zhang, Ketai Zhao, Yinxi Gao, Ziyan Zhou
We lifted 15 functions out of this paper's own repositories and ran 6 of them in a sandbox. "Ran" means the function executed on a synthesized input and returned a value. It is not a reproduction of the paper's results.
| Repository | Role | Ran |
|---|---|---|
| fvliang/DART | canonical | 6 of 15 |
| Function | Status | Where it lives |
|---|---|---|
| repeat_kv | Ran | fvliang/DART/dart/model/llama3_dart.py code served (permissive licence) · get_code("3c76e52815c5401d") |
| apply_rotary_pos_emb | Ran | fvliang/DART/dart/model/modeling_mixtral_kv.py code served (permissive licence) · get_code("d61c483a3c2b3156") |
| apply_rotary_pos_emb | Ran | fvliang/DART/dart/model/modeling_qwen3_kv.py code served (permissive licence) · get_code("583539efd6fd01fb") |
| prepare_logits_processor | Ran | fvliang/DART/dart/model/dart_utils.py code served (permissive licence) · get_code("78ae913ae6243c38") |
| rotate_half | Ran | fvliang/DART/dart/model/modeling_mixtral_kv.py code served (permissive licence) · get_code("b99eea6376d1e212") |
| rotate_half | Ran | fvliang/DART/dart/model/llama3_dart.py code served (permissive licence) · get_code("e03d53ba9d4f9ae5") |
| apply_rotary_pos_emb | Not yet run | fvliang/DART/dart/model/llama3_dart.py code served (permissive licence) · get_code("a93e62ca7757414c") |
| apply_rotary_pos_emb | Not yet run | fvliang/DART/dart/model/modeling_llama_kv.py code served (permissive licence) · get_code("eee34413e2bccab6") |
| apply_rotary_pos_emb_L31 | Not yet run | fvliang/DART/dart/model/modeling_llama_kv.py code served (permissive licence) · get_code("484407b65b6e2d25") |
| initialize_past_key_values | Not yet run | fvliang/DART/dart/model/kv_cache.py code served (permissive licence) · get_code("9315d4be39a16b19") |
| initialize_past_key_values_for_dart | Not yet run | fvliang/DART/dart/model/kv_cache.py code served (permissive licence) · get_code("13acf4d3e45fcce4") |
| initialize_past_key_values_medusa | Not yet run | fvliang/DART/dart/model/kv_cache.py code served (permissive licence) · get_code("0facd77438c97501") |
| load_balancing_loss_func | Not yet run | fvliang/DART/dart/model/modeling_mixtral_kv.py code served (permissive licence) · get_code("d9308d9bf18cd072") |
| rotate_half | Not yet run | fvliang/DART/dart/model/modeling_llama_kv.py code served (permissive licence) · get_code("ded2d9e57bfdee4e") |
| sequnce_cmp | Not yet run | fvliang/DART/dart/tree_search/tree_search.py code served (permissive licence) · get_code("d209313465058d56") |
Some links come from the archived Papers with Code dataset (CC BY-SA 4.0): attribution and licence.
Speculative decoding is an effective and lossless approach for accelerating LLM inference. However, existing widely adopted model-based draft designs, such as EAGLE3, improve accuracy at the cost of multi-step autoregressive inference, resulting in high drafting latency and ultimately rendering the drafting stage itself a performance bottleneck. Inspired by diffusion-based large language models (dLLMs), we propose DART, which leverages parallel generation to reduce drafting latency. DART predicts logits for multiple future masked positions in parallel within a single forward pass based on hidden states of the target model, thereby eliminating autoregressive rollouts in the draft model while preserving a lightweight design. Based on these parallel logit predictions, we further introduce an efficient tree pruning algorithm that constructs high-quality draft token trees with N-gram-enforced semantic continuity. DART substantially reduces draftstage overhead while preserving high draft accuracy, leading to significantly improved end-toend decoding speed. Experimental results demonstrate that DART achieves a 2.03×-3.44× wallclock time speedup across multiple datasets, surpassing EAGLE3 by 30% on average and offering a practical speculative decoding framework. Code is released at https://github.com/fvliang/DART.
The same record, over MCP at https://syntology.ai/mcp:
get_harvested_code_for_paper("2601.19278")
get_code_for_paper("2601.19278")
have("2601.19278")
Connect an agent — have() is free.