сбежавшая нейросеть 20.07.2026 04:00
Начинаем неделю с просмотра двух важных бенчмарков
Artificial Analysis ведет толковый рейтинг “глобального интеллекта” моделей – он рассчитывается как сумма из 9 бенчмарков и позволяет оценить, кто есть кто.
С лидером без сюрпризов – это Claude Fable 5, причем с учетом запросов, когда система безопасности Anthropic переключила модель на более слабую Opus 4.8. Но преимущество над вторым местом (GPT-5.6 Sol) крошечное, буквально в одно очко. Fable 5 уже не тот супер-ИИ, каким воспринимался в начале июня.
При этом проблем хватает. Первая – цена и доступность. Модель в итоге оставили на подписках Max за $100/$200, но лимиты там она жрет безумно – у меня, например, 100-долларовая подписка и к концу недельного окна я традиционно остаюсь без Fable 5.
Вторая – тот самый fallback на Opus 4.8. Модель с ним совершенно непредсказуемая: например, я могу с помощью Fable 5 готовить одну новость на две площадки – в первом случае все проходит нормально, во втором срабатывают алгоритмы безопасности. Жалоб на это в сети полно: тяжело делать серьезную работу с моделью, которая в любой момент может сбросить тебя на Opus 4.8.
И раз зашел разговор – Claude Opus 5 уже в руках тестеров, некоторые предсказывают релиз на этой неделе (ну или на протяжении двух-трех). По отзывам модель почти такая же умная, как Fable 5… и с теми же откатами на Opus 4.8 при попытках обсуждать кибербезопасность, биологию и еще несколько тем.
Переходим к GPT-5.6 Sol – как по мне, это один из лучших релизов OpenAI за последнее время. Модель почти такая же умная, как Fable 5, быстрая, с отличным веб-поиском и, наконец-то, приличным фронтендом. У меня к GPT-5.6 одна претензия – дурацкий стиль письма и на русском и на английском. Что забавно, как редактор при этом модель хороша.
Интересно, что 5.6 Sol, обладая схожими с Fable 5 характеристиками, у меня ни разу не переключалась на модель попроще. Вероятно, Anthropic перестраховались после конфликта с властями США и выкрутили ручки безопасности на максимум.
Третье место у Kimi K3. Чисто из графика можно сделать вывод, что китайцы почти нагнали американских ИИ-разработчиков, но это не так. Claude Mythos (на нем основывается Fable 5) была доступна внутри Anthropic с февраля, а ранняя версия GPT-5.6 Sol тестировалась в мае, а может и до этого. Американская паранойя с безопасностью привела к тому, что сроки выхода сдвигаются – и для массового пользователя это действительно выглядит как сокращение разрыва. Но технологически это не так.
В любом случае Kimi K3 забралась в рейтинге AA так высоко, как раньше не оказывалась ни одна из открытых китайских моделей. При этом веса выложат в общий доступ до 27 июля – можно будет скачивать, исследовать и дообучать.
Но и здесь проблемы. Спрос так высок, что Moonshot временно остановила регистрацию новых аккаунтов. И если Kimi K2.6 можно было долго пользоваться бесплатно, то K3 мне дала написать буквально несколько промптов, после чего отправила за подпиской.
Коротко по другим моделям:
— Grok 4.5 уже отстал, но Илон Маск говорит, что новая модель на 2T параметров заканчивает тренировку – ждем в ближайшие недели.
— В игру вернулась запрещенно-экстремистская Meta – пусть Muse Spark 1.1 и не попала в топ, но заявка серьезная.
— А вот Google окончательно вылетела из рейтинга. По слухам, компания очень недовольна Gemini 3.5 Pro и вновь отложила релиз. Закрывать пробел будут Gemini 3.6 Flash, но это модель другого уровня.
Второй бенчмарк – WebDev Arena – показывает, у кого из моделей получаются хорошие сайты. У Kimi K3 первое место со значительным преимуществом над Fable 5. Но добавлю, что пробовал все модели из первой десятки – и любая выдает приличный веб-дизайн. Времена кривых шрифтов и наплывающих друг на друга элементов интерфейса окончательно прошли – приличный сайт сверстает и GPT-5.6 Sol, и GLM-5.2, и Sonnet 5.
Кстати, на “Бусти” у меня есть лонгрид, как с помощью ИИ делать дизайн и визуал, которые не похожи на стандартную выдачу современных моделей. Гайдов по другим областям использования ИИ тоже хватает, так что не забывайте подписываться:
https://boosty.to/escaped_aihttps://boosty.to/escaped_ai
#vk_feedArtificial Analysis ведет толковый рейтинг “глобального интеллекта” моделей – он рассчитывается как сумма из 9 бенчмарков и позволяет оценить, кто есть кто.
С лидером без сюрпризов – это Claude Fable 5, причем с учетом запросов, когда система безопасности Anthropic переключила модель на более слабую Opus 4.8. Но преимущество над вторым местом (GPT-5.6 Sol) крошечное, буквально в одно очко. Fable 5 уже не тот супер-ИИ, каким воспринимался в начале июня.
При этом проблем хватает. Первая – цена и доступность. Модель в итоге оставили на подписках Max за $100/$200, но лимиты там она жрет безумно – у меня, например, 100-долларовая подписка и к концу недельного окна я традиционно остаюсь без Fable 5.
Вторая – тот самый fallback на Opus 4.8. Модель с ним совершенно непредсказуемая: например, я могу с помощью Fable 5 готовить одну новость на две площадки – в первом случае все проходит нормально, во втором срабатывают алгоритмы безопасности. Жалоб на это в сети полно: тяжело делать серьезную работу с моделью, которая в любой момент может сбросить тебя на Opus 4.8.
И раз зашел разговор – Claude Opus 5 уже в руках тестеров, некоторые предсказывают релиз на этой неделе (ну или на протяжении двух-трех). По отзывам модель почти такая же умная, как Fable 5… и с теми же откатами на Opus 4.8 при попытках обсуждать кибербезопасность, биологию и еще несколько тем.
Переходим к GPT-5.6 Sol – как по мне, это один из лучших релизов OpenAI за последнее время. Модель почти такая же умная, как Fable 5, быстрая, с отличным веб-поиском и, наконец-то, приличным фронтендом. У меня к GPT-5.6 одна претензия – дурацкий стиль письма и на русском и на английском. Что забавно, как редактор при этом модель хороша.
Интересно, что 5.6 Sol, обладая схожими с Fable 5 характеристиками, у меня ни разу не переключалась на модель попроще. Вероятно, Anthropic перестраховались после конфликта с властями США и выкрутили ручки безопасности на максимум.
Третье место у Kimi K3. Чисто из графика можно сделать вывод, что китайцы почти нагнали американских ИИ-разработчиков, но это не так. Claude Mythos (на нем основывается Fable 5) была доступна внутри Anthropic с февраля, а ранняя версия GPT-5.6 Sol тестировалась в мае, а может и до этого. Американская паранойя с безопасностью привела к тому, что сроки выхода сдвигаются – и для массового пользователя это действительно выглядит как сокращение разрыва. Но технологически это не так.
В любом случае Kimi K3 забралась в рейтинге AA так высоко, как раньше не оказывалась ни одна из открытых китайских моделей. При этом веса выложат в общий доступ до 27 июля – можно будет скачивать, исследовать и дообучать.
Но и здесь проблемы. Спрос так высок, что Moonshot временно остановила регистрацию новых аккаунтов. И если Kimi K2.6 можно было долго пользоваться бесплатно, то K3 мне дала написать буквально несколько промптов, после чего отправила за подпиской.
Коротко по другим моделям:
— Grok 4.5 уже отстал, но Илон Маск говорит, что новая модель на 2T параметров заканчивает тренировку – ждем в ближайшие недели.
— В игру вернулась запрещенно-экстремистская Meta – пусть Muse Spark 1.1 и не попала в топ, но заявка серьезная.
— А вот Google окончательно вылетела из рейтинга. По слухам, компания очень недовольна Gemini 3.5 Pro и вновь отложила релиз. Закрывать пробел будут Gemini 3.6 Flash, но это модель другого уровня.
Второй бенчмарк – WebDev Arena – показывает, у кого из моделей получаются хорошие сайты. У Kimi K3 первое место со значительным преимуществом над Fable 5. Но добавлю, что пробовал все модели из первой десятки – и любая выдает приличный веб-дизайн. Времена кривых шрифтов и наплывающих друг на друга элементов интерфейса окончательно прошли – приличный сайт сверстает и GPT-5.6 Sol, и GLM-5.2, и Sonnet 5.
Кстати, на “Бусти” у меня есть лонгрид, как с помощью ИИ делать дизайн и визуал, которые не похожи на стандартную выдачу современных моделей. Гайдов по другим областям использования ИИ тоже хватает, так что не забывайте подписываться:
https://boosty.to/escaped_aihttps://boosty.to/escaped_ai
Комментарии (0)
Пока нет комментариев. Будьте первым!