сбежавшая нейросеть 27.07.2026 04:05
Главное достижение Claude Opus 5 – 30,2% на ARC-AGI-3
Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.
Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.
Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.
Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.
Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).
“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.
В ARC Prize отмечают, что впервые видят такое поведение у модели.
Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.
Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.
Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.
Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.
Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.
Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.
Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.
Самое время подписаться!Самое время подписаться!
#vk_feedЭто в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.
Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.
Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.
Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.
Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).
“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.
В ARC Prize отмечают, что впервые видят такое поведение у модели.
Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.
Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.
Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.
Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.
Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.
Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.
Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.
Самое время подписаться!Самое время подписаться!
Комментарии (0)
Пока нет комментариев. Будьте первым!