Keep Drafting Parallel
AI & ML interests
Efficient AI
Recent Activity
View all activity
Papers
DFlash: Block Diffusion for Flash Speculative Decoding
ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
Block Diffusion for Flash Speculative Decoding
Flash Vision-Language-Action Inference for Autonomous Driving
Streaming Action Decoding for Fast and Asynchronous VLA Inference
Pairwise Rotation Quantization
-
ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
Paper • 2511.10645 • Published • 14 -
z-lab/Qwen3.8-27B-PARO
Image-Text-to-Text • 6B • Updated • 1.51k • 13 -
z-lab/Qwen3.6-27B-PARO
Image-Text-to-Text • 6B • Updated • 423 • 33 -
z-lab/Qwen3.6-35B-A3B-PARO
Image-Text-to-Text • 6B • Updated • 1.82k • 9
Accelerating LLM Fine-Tuning with Contextual Sparsity
Keep Drafting Parallel
Streaming Action Decoding for Fast and Asynchronous VLA Inference
Block Diffusion for Flash Speculative Decoding
Pairwise Rotation Quantization
-
ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
Paper • 2511.10645 • Published • 14 -
z-lab/Qwen3.8-27B-PARO
Image-Text-to-Text • 6B • Updated • 1.51k • 13 -
z-lab/Qwen3.6-27B-PARO
Image-Text-to-Text • 6B • Updated • 423 • 33 -
z-lab/Qwen3.6-35B-A3B-PARO
Image-Text-to-Text • 6B • Updated • 1.82k • 9
Flash Vision-Language-Action Inference for Autonomous Driving
Accelerating LLM Fine-Tuning with Contextual Sparsity