FrontierBench: Новый бенчмарк для оценки ИИ-моделей
Ключевые факты
- 1 Бенчмарк TerminalBench переименован во FrontierBench.
- 2 FrontierBench включает 74 уникальные, реалистичные задачи с акцентом на экономическую ценность.
- 3 Задачи охватывают программирование, финансы, логистику и требуют адаптивного решения.
- 4 GPT-5.6 Sol и Fable лидируют, решая около трети задач.
- 5 GPT-5.6 Sol примерно на 40% дешевле и использует на 50% меньше токенов, чем Fable 5.
- 6 Terra показывает результаты на уровне Opus 4.8 и GPT-5.5.
- 7 Sonnet 5 признана менее эффективной и более дорогой, чем Fable 5.
- 8 Grok-4.5 отличается экономичностью и немногословностью.
Изначально планировавшийся как третья версия TerminalBench, новый бенчмарк получил название FrontierBench. Он включает 74 уникальные задачи, разработанные вручную, охватывающие различные домены, включая программирование, финансы и логистику. Основной упор сделан на реалистичность и экономическую ценность решений, требующих от ИИ-агентов адаптации к изменяющимся условиям и выполнения сложных многоэтапных операций. Примеры задач включают оптимизацию медленного KV-cache без прерывания работы, расчет резервного капитала банка с учетом залогов и регуляторных правил, а также работу диспетчером доставки стройматериалов с динамическим учетом заказов, цен и доступности ресурсов. Бенчмарк оценивает качество текущих моделей, где лидируют GPT-5.6 Sol и Fable, решая примерно треть задач. Отмечается, что GPT-5.6 Sol демонстрирует сопоставимые результаты с Fable, при этом используя меньше токенов и являясь примерно на 40% дешевле. Также выделяется модель Terra, которая показывает результаты на уровне Opus 4.8 и даже 5.5, что превзошло ожидания. Sonnet 5, напротив, оказалась менее эффективной и более дорогой по сравнению с Fable 5. Grok-4.5 отмечен за свою экономичность и немногословность. Авторы бенчмарка подчеркивают различия в подходах агентов к решению задач, даже при схожих показателях качества: некоторые модели используют больше токенов и меньше действий, другие — меньше токенов и больше действий.