Frontier-Engineering
A benchmark of 47 real-world engineering optimization tasks for evaluating iterative AI agents under verifier-grounded feedback.
A benchmark of 47 real-world engineering optimization tasks for evaluating iterative AI agents under verifier-grounded feedback.
- Project page: https://lab.einsia.ai/frontier-eng/
- Paper: https://arxiv.org/abs/2604.12290
- Leaderboard: https://lab.einsia.ai/frontier-eng/leaderboard/
- Code: https://github.com/EinsiaLab/Frontier-Engineering
- Media coverage: https://mp.weixin.qq.com/s/4OAjSsihL0T1T9mfXmszDQ