Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published Jul 21 • 11
Knowledge Extraction on Semi-Structured Content: Does It Remain Relevant for Question Answering in the Era of LLMs? Paper • 2509.25107 • Published Sep 29, 2025
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning Paper • 2510.01832 • Published Oct 2, 2025
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality Paper • 2508.00109 • Published Jul 31, 2025 • 4
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning Paper • 2403.11401 • Published Mar 18, 2024
Post-training an LLM for RAG? Train on Self-Generated Demonstrations Paper • 2502.10596 • Published Feb 14, 2025
Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published Jul 21 • 11
InvisMark: Invisible and Robust Watermarking for AI-generated Image Provenance Paper • 2411.07795 • Published Nov 19, 2024
BayesCap: Bayesian Identity Cap for Calibrated Uncertainty in Frozen Neural Networks Paper • 2207.06873 • Published Jul 14, 2022
The Amazon Nova Family of Models: Technical Report and Model Card Paper • 2506.12103 • Published Mar 17, 2025 • 1
Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance Paper • 2511.13254 • Published Nov 17, 2025 • 140
What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity Paper • 2511.15593 • Published Nov 19, 2025 • 59
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents Paper • 2602.06855 • Published Feb 6 • 83