Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Paper • 2608.05139 • Published Aug 5 • 28
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Paper • 2606.25178 • Published Jun 27 • 8
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Paper • 2606.25178 • Published Jun 27 • 8
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR Paper • 2606.25178 • Published Jun 27 • 8
Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision Paper • 2604.12002 • Published Apr 13 • 12