Назад к ленте

Grok 4.5 обошел Claude Fable 5 и Opus 4.8 в тесте ИИ-агентов

📅 09.07.2026 17:00

<p><strong>Илон Маск сравнил Grok 4.5 с Claude Opus по возможностям, добавив, что новая модель работает быстрее и дешевле. Независимый бенчмарк подтвердил слова миллиардера.</strong></p>

<p>В <a href="https://artificialanalysis.ai/evaluations/automationbench-aa?cost=cost-per-task" rel="noreferrer noopener nofollow" target="_blank">тесте AutomationBench-AA от Artificial Analysis </a>модель Grok 4.5 заняла первое место с результатом 51,4% при стоимости $0,34 за задачу. Она обошла Claude Fable 5 (48,6%) и Claude Opus 4.8 (48,5%).</p>

<section class="c-bic-highlighted-text mb-8 md:mb-12 " id="block_6a4fa0d6d20f0">
<div class="flex items-center gap-5 px-5 py-4 rounded-xl bg-grey-50 text-dark-grey-700">
<svg class="min-w-5 h-5 text-blue-600" fill="none" height="28" viewBox="0 0 28 28" width="28" xmlns="http://www.w3.org/2000/svg"><path d="m11.195 26.6 1.4-9.8h-4.9c-.812 0-.798-.448-.532-.924.266-.476.07-.112.098-.168L16.795 1.4l-1.4 9.8h4.9c.686 0 .784.462.658.714l-.098.21-9.66 14.476Z" fill="currentColor"></path></svg>
<div class="bic-block-highlighted-paragraph-content p3 p3--ns [&_p:last-child]:!mb-0 [&_p]:!leading-6 [&_p]:!font-body [&_p]:!text-4 [&_a]:!text-blue-600">
<p><strong><em>Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш</em></strong><a href="https://t.me/beincrypto_trading"><strong><em> телеграм-канал</em></strong></a><strong><em>, обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!</em></strong></p>

</div>
</div>
</section>

<figure class="wp-block-image size-full"><img alt="Результаты AI-моделей на AutomationBench-AA." class="wp-image-385386" src="https://assets.beincrypto.com/img/0HlmiS7esJ5yKH9R_n5F9vOsLcY=/smart/146677daa84c4e7096101e7a6ba2040e" /><figcaption class="wp-element-caption">Результаты AI-моделей на AutomationBench-AA. Источник: <a href="https://artificialanalysis.ai/evaluations/automationbench-aa?cost=cost-per-task" rel="noreferrer noopener nofollow" target="_blank">Artificial Analysis</a></figcaption></figure>

<h2 class="bic-gutenberg-heading wp-heading wp-block-heading" id="h-независимая-проверка-утверждений-илона-маска">Независимая проверка утверждений Илона Маска</h2>

<p>SpaceXAI на этой неделе представила Grok 4.5 на архитектуре V9 с 1,5 трлн параметров. Свою оценку возможностей модели Маск основывал на внутренних тестах команды.</p>

<p>Результаты AutomationBench-AA меняют расклад на рынке. Artificial Analysis проводит эти замеры независимо и держит список заданий в секрете, чтобы результаты оставались объективными.</p>

<p>Тест включает 657 заданий в 40 симулированных приложениях, среди которых Gmail, Slack, Salesforce и HubSpot. Итоговый балл показывает долю задач, которые агент выполнил, не нарушив заложенные в них правила.</p>

<h2 class="bic-gutenberg-heading wp-heading wp-block-heading" id="h-grok-4-5-дешевле-быстрее-и-чаще-остальных-соблюдает-правила">Grok 4.5: дешевле, быстрее и чаще остальных соблюдает правила</h2>

<p>Grok 4.5 выполняет задачу за $0,34 — заметно дешевле, чем Fable 5 ($1,35) и Opus 4.8 ($1,46). Ближе других подобралась Gemini 3.5 Flash — $0,49 за задачу.</p>

<p>Для выполнения одной задачи Grok 4.5 использует около 8000 выходных токенов — это примерно 25% ресурсов Opus 4.8. Такая эффективность формирует ключевое преимущество по цене. Именно на этом Маск делал акцент при запуске.</p>

<blockquote class="max-w-xl text-4.5 border-l-2 border-blue-600 pl-11 mb-9 select-all [&_p]:!mb-0 wp-block-quote is-layout-flow wp-block-quote-is-layout-flow">
<p>«Суммарное потребление токенов — 0,44 млн на задачу — один из самых низких показателей среди всех моделей. Минимальная стоимость достигается за счет такой эффективности и низкой цены токена», — пояснили представители Artificial Analysis <a href="https://x.com/ArtificialAnlys/status/2075047187525034114" rel="noreferrer noopener nofollow" target="_blank">в соцсети X</a>.</p>
</blockquote>

<p>Кроме того, Grok 4.5 верно выполнил 79,9% отдельных действий, а полностью, от начала до конца, довел 21,9% задач. В финансах — самой трудной категории теста — модель показала лучший результат — 71%. Fable 5 набрал 64%, Opus 4.8 — 62%.</p>

<p>Модель при этом нарушала правила чаще конкурентов: в среднем 0,63 нарушения на задание. У Opus 4.8 — 0,55, у Gemini 3.5 Flash — 0,46.</p>

<p>Для компаний, которые запускают агентов в действующих финансовых системах, этот разрыв критичен: одно нарушение способно обернуться заметными убытками.</p>

<p><strong><em>

Рекомендованный контент