AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Paper • 2608.05987 • Published Aug 6 • 102
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use Paper • 2606.30251 • Published Jun 29 • 23
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles Paper • 2605.22177 • Published May 21 • 21