Atria Dawn: The Dawn of Agentic Superintelligence Paper β’ 2609.15818 β’ Published 9 days ago β’ 421
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents Paper β’ 2609.08149 β’ Published 15 days ago β’ 28 β’ 4
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents Paper β’ 2609.08149 β’ Published 15 days ago β’ 28
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents Paper β’ 2609.08149 β’ Published 15 days ago β’ 28
AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities Paper β’ 2607.13705 β’ Published Jul 15 β’ 40
CIBench: Evaluating Your LLMs with a Code Interpreter Plugin Paper β’ 2407.10499 β’ Published Jul 15, 2024
MIG: Automatic Data Selection for Instruction Tuning by Maximizing Information Gain in Semantic Space Paper β’ 2504.13835 β’ Published Apr 18, 2025 β’ 39
DataChef: Cooking Up Optimal Data Recipes for LLM Adaptation via Reinforcement Learning Paper β’ 2602.11089 β’ Published Feb 11 β’ 18
Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale Paper β’ 2603.25040 β’ Published Mar 26 β’ 132
TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration Paper β’ 2604.14116 β’ Published Apr 15 β’ 13
TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration Paper β’ 2604.14116 β’ Published Apr 15 β’ 13
Running on CPU Upgrade Agents 1.03k Open VLM Leaderboard π 1.03k VLMEvalKit Evaluation Results Collection