Intern-S2-Preview: Scientific Agentic Foundation Model Paper • 2608.13505 • Published 9 days ago • 66
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published 9 days ago • 52
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Paper • 2608.09873 • Published 12 days ago • 29
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published 23 days ago • 72
UEmbed: Unified Sparse and Dense Multimodal Embeddings Paper • 2608.02583 • Published 19 days ago • 50
Metacognition in LLMs: Foundations, Progress, and Opportunities Paper • 2607.11881 • Published Jul 13 • 30
Dockerless: Environment-Free Program Verifier for Coding Agents Paper • 2606.28436 • Published Jun 26 • 116