papers BrowserBC BrowserBC distills successful human browser trajectories into reusable skills, helping web agents solve tasks with higher success rates and fewer interactions. benchmarks Frontier-Engineering A benchmark of 47 real-world engineering optimization tasks for evaluating iterative AI agents under verifier-grounded feedback. AI4AI-Bench A benchmark for evaluating LLM agents on algorithmic design for recursive self-improvement. Media Coverage BrowserBC: 机器之心 Frontier-Engineering: 机器之心