ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks Paper • 2508.15804 • Published Aug 14, 2025 • 15
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets? Paper • 2510.02209 • Published Oct 2, 2025 • 57
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning Paper • 2511.16043 • Published Nov 20, 2025 • 110
Multi-Turn Agentic Scientific Literature Search via Workflow Induction Paper • 2607.00597 • Published Jul 1 • 31
Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution Paper • 2608.07645 • Published 8 days ago • 26
SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries Paper • 2608.05604 • Published 9 days ago • 73
SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure Paper • 2608.11079 • Published 4 days ago • 16