Загрузка котировок…
Радар.

Grok 4.6: новый уровень агентного интеллекта или просто маркетинг?

1 ч назад · ⏱ 1 мин чтения
Grok 4.6 вышел: разбираем тесты и цену долгих задач
🧠 Grok 4.6: новый уровень агентного интеллекта или просто маркетинг?

SpaceXAI представила Grok 4.6, и эта модель уже успела наделать шума в мире искусственного интеллекта. С 500 тысячами токенов контекста и четырьмя уровнями рассуждения, она обещает стать настоящим мастером для длительных агентных задач. В первых тестах Grok 4.6 показал себя достойным конкурентом, особенно в CursorBench, где его эффективность оценивается в 2,81 доллара за задание. Но не все так радужно: после 200 тысяч токенов тарифы начинают кусаться.

> "Grok 4.6 заметно сильнее предыдущей версии", — так говорят разработчики, и подтверждают это ростом индекса Artificial Analysis с 56 до 61. Но не стоит забывать, что конкуренты все еще наступают на пятки.

Grok 4.6 — это универсальный агент, который отлично справляется с задачами, требующими глубокого понимания и длительного погружения. Он может работать с текстом, изображениями и поддерживает до 500 тысяч токенов контекста. Есть возможность подключать API и использовать функции, веб-поиск и выполнение кода. Однако, на тестах вроде DeepSWE или Terminal-Bench, Grok все еще немного уступает лидерам.

◾️ Контекст: до 500 тысяч токенов
◾️ Уровни рассуждения: 4 (низкий, средний, высокий, сверхвысокий)
◾️ Средняя стоимость задания: 2,81 доллара
◾️ Сводный индекс Artificial Analysis: вырос с 56 до 61
◾️ DeepSWE: 65,9%
◾️ Terminal-Bench: 26%

Так кто же победит в этой битве интеллектов — Grok 4.6 или его конкуренты? Или все-таки дело в цене и задачах?
Оцените:
Первоисточник ↗
Комментарии

Пока нет комментариев — будьте первым.

Читайте также