Grounded Skill Synthesis from Code at Scale for Agentic Intelligence Paper • 2609.05571 • Published 18 days ago • 92
CodeMidas: Scaling Agentic Coding RL Environments from Code Itself Paper • 2609.22068 • Published 4 days ago • 103
CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation Paper • 2609.04083 • Published 19 days ago • 27
GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments Paper • 2609.00048 • Published 23 days ago • 8
PaperGym: Rubric-Centered Evolution for Research-Plan Generation Paper • 2608.31119 • Published 22 days ago • 33
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Paper • 2608.27456 • Published 26 days ago • 87
Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments Paper • 2608.24099 • Published 28 days ago • 12
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published Aug 13 • 59
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Paper • 2608.09873 • Published Aug 10 • 29
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published Jul 30 • 75