GPT-5.6 установила рекорд, набрав 136 баллов в закрытом IQ-тесте
Новая языковая модель GPT-5.6 продемонстрировала рекордный результат в закрытом IQ-тесте, набрав 136 баллов. По общепринятой шкале такой показатель соответствует уровню примерно 1% населения, однако авторы исследования подчёркивают, что речь идёт исключительно о тестах на логическое мышление, а не об универсальном интеллекте.
GPT-5.6 стала лидером закрытого тестирования
По данным проекта Tracking AI, версии GPT-5.6 Sol и GPT-5.6 Terra набрали по 136 баллов в закрытом IQ-тесте.
Такой же результат показали мультимодальные версии моделей с поддержкой работы с изображениями.
Для сравнения:
- Claude Fable 5 набрала 130 баллов;
- GPT-5.6 Luna Max — 123 балла.
Почему использовался закрытый тест
Для оценки возможностей языковых моделей Tracking AI применяет сразу два набора заданий.
Первый основан на открытом тесте Mensa Norway, поэтому существует вероятность, что его вопросы могли попасть в обучающие данные некоторых нейросетей.
Второй тест остаётся закрытым. По словам авторов проекта, его задания подготовил участник Mensa, а сами вопросы ранее никогда не публиковались в открытом доступе. Такой подход позволяет снизить вероятность того, что модель просто запомнила правильные ответы.
Что означает результат в 136 баллов
IQ-тест оценивает способность модели находить закономерности, логически рассуждать и решать абстрактные задачи.
При этом разработчики отдельно подчёркивают, что результат 136 баллов не означает, что GPT-5.6 превосходит 99% людей во всех интеллектуальных задачах.
Он лишь показывает высокий уровень решения именно тех задач, которые входят в подобные тесты.
Модель также проверили на практических задачах
Помимо IQ-тестирования, сторонние разработчики провели несколько практических экспериментов.
В одном из них разработчик Амир Бохлули попросил GPT-5.6 Sol и Claude Fable 5 создать физическую симуляцию.
По его словам, GPT-5.6 самостоятельно подготовила модель движения частиц, пользовательский интерфейс и визуальное оформление, объединив всё в один HTML-файл, после чего разместила готовый проект на отдельной веб-странице.
За один запрос собрала систему обработки обращений
Во втором эксперименте GPT-5.6 Sol получила один подробный запрос на создание системы обработки клиентских обращений на базе RAG.
В результате модель сформировала полноценное решение, включающее:
- четыре уровня пользователей;
- административную панель;
- редактор базы знаний;
- виджет для интеграции на сайты.
Кроме того, система могла автоматически определять категорию обращения, анализировать эмоциональную окраску сообщения, выставлять приоритет и готовить черновик ответа оператору.
Практические тесты нельзя считать полноценным сравнением
Авторы Tracking AI отмечают, что практические проекты создавались независимыми разработчиками, а не самой командой исследования.
Поэтому такие эксперименты демонстрируют возможности GPT-5.6 в реальных сценариях, однако не могут использоваться как объективное сравнение с другими языковыми моделями.
