Rethinking On-Policy Distillation of Large Language Models II: One Training Example Paper • 2609.04172 • Published 13 days ago • 97
Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs Paper • 2609.02548 • Published 14 days ago • 1
TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection Paper • 2507.03673 • Published Jul 4, 2025
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding Paper • 2603.22763 • Published Mar 24
Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation Paper • 2605.21125 • Published May 30
Efficient Hallucination Detection: Adaptive Bayesian Estimation of Semantic Entropy with Guided Semantic Exploration Paper • 2603.22812 • Published Mar 24
MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias Paper • 2606.17953 • Published Jun 16
StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning Paper • 2606.00148 • Published May 29
Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs Paper • 2609.02548 • Published 14 days ago • 1
yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF Text Generation • 12B • Updated Jun 19 • 678k • 1.58k
Running Agents 25 Croissant Checker - Dev 🔎 25 Validate Croissant dataset files for NeurIPS submissions