AIM-Intelligence/COMPASS-Policy-Alignment-Testbed-Dataset Viewer • Updated 26 days ago • 5.92k • 738 • 12
NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap Paper • 2608.04397 • Published Aug 5 • 23
NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms Paper • 2606.20408 • Published Jul 6 • 3
NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap Paper • 2608.04397 • Published Aug 5 • 23
NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms Paper • 2606.20408 • Published Jul 6 • 3
EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards Paper • 2607.00218 • Published Jun 30 • 1
When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models Paper • 2508.03483 • Published Jun 17 • 1
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models Paper • 2605.27851 • Published May 27 • 1
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity Paper • 2605.05662 • Published May 7 • 11
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity Paper • 2605.05662 • Published May 7 • 11
What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models Paper • 2601.06165 • Published Jan 7 • 16
What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models Paper • 2601.06165 • Published Jan 7 • 16
Global PIQA: Evaluating Physical Commonsense Reasoning Across 100+ Languages and Cultures Paper • 2510.24081 • Published Oct 28, 2025 • 24
Distribution-Level Feature Distancing for Machine Unlearning: Towards a Better Trade-off Between Model Utility and Forgetting Paper • 2409.14747 • Published Sep 23, 2024
COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs Paper • 2601.01836 • Published Jan 5 • 10
One-Shot is Enough: Consolidating Multi-Turn Attacks into Efficient Single-Turn Prompts for LLMs Paper • 2503.04856 • Published Mar 6, 2025 • 2
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety Paper • 2502.04757 • Published Feb 7, 2025 • 2