FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience Paper • 2609.03241 • Published 12 days ago • 98
Dr. Claw: An AI Scientist Workspace for Vibe Research Paper • 2609.00365 • Published 15 days ago • 181
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems Paper • 2609.02750 • Published 13 days ago • 146
AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale Paper • 2608.20634 • Published 25 days ago • 12
Ko-WideSearch Collection Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents • 2 items • Updated 28 days ago • 1
AgentMercury Collection AGENTMERCURY: YOUR AGENT CAN SYNTHESIZE VERIFIABLE ENVIRONMENTS FOR BUSINESS SCENARIOS AT SCALE • 13 items • Updated 19 days ago • 2
See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models Paper • 2607.11498 • Published Jul 13 • 8
Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity Paper • 2607.00248 • Published Jun 30 • 33
MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training Paper • 2606.30406 • Published Jun 29 • 25
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement Paper • 2607.00446 • Published Jul 1 • 25
Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents Paper • 2606.27595 • Published Jun 25 • 9
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents Paper • 2606.28480 • Published Jun 26 • 49
Agentic Abstention: Do Agents Know When to Stop Instead of Act? Paper • 2606.28733 • Published Jun 27 • 151
Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning Paper • 2606.31825 • Published Jun 30 • 30
SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning Paper • 2606.22873 • Published Jun 22 • 17