AI & LLM
7
Вес: Значительный

FrontierBench: Новый бенчмарк для оценки ИИ-моделей

Seeallochnaya 24.07.2026 — 10:57

Ключевые факты

  • 1 Бенчмарк TerminalBench переименован во FrontierBench.
  • 2 FrontierBench включает 74 уникальные, реалистичные задачи с акцентом на экономическую ценность.
  • 3 Задачи охватывают программирование, финансы, логистику и требуют адаптивного решения.
  • 4 GPT-5.6 Sol и Fable лидируют, решая около трети задач.
  • 5 GPT-5.6 Sol примерно на 40% дешевле и использует на 50% меньше токенов, чем Fable 5.
  • 6 Terra показывает результаты на уровне Opus 4.8 и GPT-5.5.
  • 7 Sonnet 5 признана менее эффективной и более дорогой, чем Fable 5.
  • 8 Grok-4.5 отличается экономичностью и немногословностью.

Изначально планировавшийся как третья версия TerminalBench, новый бенчмарк получил название FrontierBench. Он включает 74 уникальные задачи, разработанные вручную, охватывающие различные домены, включая программирование, финансы и логистику. Основной упор сделан на реалистичность и экономическую ценность решений, требующих от ИИ-агентов адаптации к изменяющимся условиям и выполнения сложных многоэтапных операций. Примеры задач включают оптимизацию медленного KV-cache без прерывания работы, расчет резервного капитала банка с учетом залогов и регуляторных правил, а также работу диспетчером доставки стройматериалов с динамическим учетом заказов, цен и доступности ресурсов. Бенчмарк оценивает качество текущих моделей, где лидируют GPT-5.6 Sol и Fable, решая примерно треть задач. Отмечается, что GPT-5.6 Sol демонстрирует сопоставимые результаты с Fable, при этом используя меньше токенов и являясь примерно на 40% дешевле. Также выделяется модель Terra, которая показывает результаты на уровне Opus 4.8 и даже 5.5, что превзошло ожидания. Sonnet 5, напротив, оказалась менее эффективной и более дорогой по сравнению с Fable 5. Grok-4.5 отмечен за свою экономичность и немногословность. Авторы бенчмарка подчеркивают различия в подходах агентов к решению задач, даже при схожих показателях качества: некоторые модели используют больше токенов и меньше действий, другие — меньше токенов и больше действий.

Источник