Кто умнее, быстрее и лучше врёт с уверенным видом?

ПРОДОЛЖЕНИЕ. ПРЕДЫДУЩЕЕ ЗДЕСЬ. НАЧАЛО ЗДЕСЬ

Ещё недавно искусственный интеллект представляли как некий единый электронный разум. Где-то в огромном компьютере сидит цифровой мудрец, знает почти всё на свете и терпеливо отвечает людям на вопросы. На практике всё оказалось гораздо веселее... Сегодня существует множество моделей искусственного интеллекта...

Одни прекрасно пишут программы, другие работают с изображениями, третьи быстро перелопачивают длинные документы, четвёртые рассуждают медленно, зато обстоятельно. И все их разработчики время от времени объявляют:
— Наша модель теперь самая умная!
Через неделю конкуренты выкатывают обновление и отвечают:
— Уже нет.
Так начинается очередной сезон чемпионата мира среди нейросетей.

На ринг выходят модели. Раунд первый: кто лучше отвечает на вопросы

Современная языковая модель — это не энциклопедия с готовыми ответами и не электронный человек, спрятанный внутри сервера. Это сложная вычислительная система, обученная продолжать текст, распознавать связи между словами, изображениями, звуками, программным кодом и другими данными. Она получает запрос и шаг за шагом строит ответ. Условно говоря, модель постоянно решает задачу: какое продолжение здесь наиболее вероятно и уместно? Но за этой скромной формулировкой скрывается огромная работа. Чтобы написать несколько абзацев, система может учитывать смысл вопроса, предыдущие реплики, стиль пользователя, факты из подключённых источников и результаты промежуточных рассуждений.
В нынешних соревнованиях участвуют целые семейства моделей: GPT, Claude, Gemini, Llama, Grok и множество открытых систем китайских, европейских и независимых разработчиков. Причём внутри одной семьи обычно имеется несколько «весовых категорий»: большая и дорогая модель, универсальная средняя и маленькая быстрая. Это примерно как автомобильный рынок. Есть представительский лимузин, семейный кроссовер и городской автомобиль, который легко припарковать, но везти на нём рояль через болото всё-таки не стоит. Самый очевидный способ сравнить модели — задать им одинаковые вопросы. Например:

«Почему небо голубое?»
«Кто виноват в Троянской войне?»
«Что делать, если компьютер включается, но изображения на экране нет?»

Простые вопросы сильные модели проходят почти без потерь. Настоящая битва начинается там, где требуется соединить несколько фактов, заметить скрытое условие или признать, что исходных данных недостаточно. Именно последнее особенно важно. Старая модель нередко рассуждала примерно так: «Я не знаю, но сейчас быстро что-нибудь сочиню». — Современные системы лучше обучены замечать неопределённость. Однако полностью искоренить выдумки пока не удалось. Модель может неверно назвать дату, перепутать автора или сослаться на статью, которой никогда не существовало. Это явление называют галлюцинацией. Термин звучит почти романтично, хотя для пользователя результат бывает менее поэтичным: искусственный интеллект уверенно сообщает, что Пушкин получил Нобелевскую премию по литературе лично из рук Альфреда Нобеля. Поэтому хорошую модель отличает не только количество правильных ответов. Важна её способность вовремя сказать: «Здесь я не уверен(а). Давайте проверим источник».

Второй-третий раунды: математика-логика-программирование

Долгое время математические задачи были для языковых моделей чем-то вроде банановой кожуры в старой кинокомедии. Модель могла блестяще объяснить устройство квантового компьютера, а затем ошибиться при подсчёте сдачи в магазине. Причина проста: язык допускает приблизительность, арифметика — нет. Новые системы используют режимы усиленного рассуждения. Перед тем как выдать итог, модель разбивает задачу на этапы, проверяет промежуточные результаты, иногда обращается к вычислительным инструментам. Ответ появляется медленнее, зато вероятность ошибки уменьшается. Но и здесь есть ловушка. Длинное рассуждение ещё не означает правильное рассуждение. Человек тоже способен двадцать минут очень убедительно идти не в ту сторону.
Поэтому математические испытания проверяют не красоту объяснения, а — конечный результат. В некоторых тестах моделям дают школьные задачи, в других — задания университетского уровня, научные проблемы или ситуации, где нужно самостоятельно выбрать метод решения. Именно на таких испытаниях выясняется, что понятие «самая умная модель» слишком расплывчато. Одна система лучше решает геометрию, другая — программирование, третья — задачи, сформулированные обычным разговорным языком. Абсолютного чемпиона пока нет. Есть многоборцы и специалисты. На соревнованиях по написанию кода искусственный интеллект чувствует себя особенно уверенно. Программный код хорошо структурирован, а результат часто можно автоматически проверить: запускается программа или нет, проходит тесты или падает с ошибкой и уходит размышлять о смысле цифровой жизни. Модели умеют:

  • дописывать функции;
  • находить ошибки;
  • объяснять чужой код;
  • переводить программы с одного языка на другой;
  • создавать сайты и небольшие приложения;
  • работать с репозиториями, терминалом и системой управления версиями.

Но написать двадцать строк кода и самостоятельно исправить сложный промышленный проект — совершенно разные дисциплины. Во втором случае модели приходится изучить десятки файлов, понять архитектуру программы, найти источник сбоя, внести изменения и не сломать всё остальное. Это уже не обычный чат-бот, а программный агент. И здесь результаты тестов следует читать осторожно. В 2026 году OpenAI сообщила, что один из популярных тестов для программистских моделей перестал надёжно отражать способности передовых систем: часть заданий имела дефектные проверки, способные отклонять даже функционально правильные решения. Иначе говоря, участник мог решить задачу, но электронный судья всё равно показывал красную карточку. Это важный урок: иногда модель проигрывает не задаче, а плохо составленному экзамену.

Четвёртый-пятый раунды: скорость против глубины + длинная память

Представим две модели... Первая отвечает почти мгновенно. Вторая думает полминуты, зато анализирует больше вариантов. Которая лучше? Если нужно перевести короткое письмо, вероятно, первая. Если требуется изучить договор, найти противоречия и подготовить аргументированное заключение — вторая. Современные разработчики поэтому создают не одну универсальную модель, а линейку систем. В семействе GPT-5.6, например, модели разделены по сочетанию мощности, скорости и стоимости. Аналогичный принцип используют другие компании: у них есть тяжёлые флагманские модели и облегчённые версии для массовых задач. 
Маленькая модель не обязательно глупая. Она может быть специально оптимизирована для быстрого перевода, сортировки писем, составления кратких ответов или работы непосредственно на устройстве. Сравнивать её с крупнейшей системой в сложной научной задаче — всё равно что устраивать гонку между курьерским скутером и карьерным самосвалом, а затем удивляться, почему самосвал плохо развозит пиццу.
Ещё одна арена — объём контекста. Контекстом называют информацию, которую модель может учитывать во время текущей работы: вопрос пользователя, предыдущие сообщения, документы, таблицы, фрагменты программы. Чем больше контекстное окно, тем более объёмные материалы можно передать модели. Некоторые современные системы способны принять целую книгу, большой программный проект или сотни страниц документации. Но число доступных знаков — только половина дела. Представьте человека, которому выдали тысячу страниц и сказали: «Ответ спрятан где-то внутри. Возможно, на странице 614. А возможно, в примечании мелким шрифтом». — Формально человек прочитал весь документ. Практически — он может пропустить нужное место.
То же происходит с моделями. Они проходят специальные испытания на поиск фактов в длинном контексте. Иногда в огромный текст искусственно помещают несколько важных фраз и проверяют, сможет ли система их обнаружить и правильно связать. Хорошая длинная память — это не способность проглотить библиотеку. Это способность после — вспомнить, на какой полке стояла нужная книга.

Раунд шестой: текст, изображения, голос и видео

Первые популярные языковые модели в основном работали с текстом. Современные всё чаще становятся мультимодальными. Это означает, что одна система может анализировать фотографию, читать документ, слушать речь, обсуждать диаграмму и отвечать голосом. Например, пользователь показывает снимок электрического щита и спрашивает, какой автомат отвечает за кухню. Или загружает график продаж и просит объяснить, почему в апреле произошёл провал. Или включает камеру и просит помочь собрать устройство. Однако мультимодальность создаёт новые виды ошибок…
Модель может неверно прочитать мелкую надпись, принять отражение за предмет, перепутать элементы диаграммы или «увидеть» деталь, которой на изображении нет. Посему испытания становятся всё более разнообразными. Модели проверяют не только на знание текста, но и на понимание изображений, звука, видео и сочетаний разных типов данных. Google, например, описывает свои современные Gemini как мультимодальные модели, а их карточки отдельно фиксируют возможности, ограничения и результаты оценивания.

Седьмой: агент выходит из чата, или Что такое бенчмарк и почему все им размахивают?

Обычная модель отвечает на вопрос. Агент должен выполнить задачу. Допустим, пользователь просит: «Найди подходящие варианты поездки, сравни цены, проверь календарь и составь план». — Простой чат-бот напишет советы. Агент может последовательно использовать поиск, карты, календарь, электронную почту и таблицы. Для того ему приходится решать, какой инструмент вызвать, какие данные проверить и что делать, если первый путь не сработал. Именно здесь начинается самое интересное... Модель может прекрасно рассуждать в одном ответе, но потеряться в длинной последовательности действий. Например:

  1. Правильно найти нужный документ.
  2. Правильно извлечь сумму.
  3. Правильно открыть таблицу.
  4. Вставить сумму не в ту строку.
  5. Гордо сообщить, что работа выполнена.

Поэтому агентные тесты проверяют не отдельный ответ, а весь маршрут от задания до результата. Некоторые новые испытания моделируют научную работу, работу программиста или управление компьютером. В научных тестах даже самые сильные системы пока могут успешно пройти лишь часть сложных задач, что хорошо охлаждает разговоры о появлении всезнающего электронного профессора. Далее…
Бенчмарк — стандартный набор заданий, используемый для сравнения моделей. Слово солидное, но по существу это контрольная работа. Одни бенчмарки проверяют знания. Другие — логику, математику, программирование, работу с изображениями или способность управлять компьютером. Результаты обычно выражают в процентах. И тут начинается маркетинговая магия. Компания может заявить: «Наша модель набрала 87,3 процента и превзошла конкурента!» — Но необходимо спросить:

На каком тесте?
В каком режиме?
Сколько попыток разрешалось?
Использовала ли модель внешние инструменты?
Как считали стоимость?
Были ли задания доступны в интернете?
Не обучалась ли модель на похожих примерах?

Разница в один процент иногда действительно важна. А иногда это статистический шум, особенности настроек или удачно выбранный набор задач. Кроме того, каждая компания предпочитает демонстрировать те дисциплины, где её модель выглядит особенно эффектно. Производитель спортивного автомобиля расскажет о великолепном разгоне до ста километров в час. Производитель грузовика почему-то не станет отвечать тем же показателем и предложит обсудить мощную грузоподъёмность.

Открытые-закрытые модели. Дистилляция

Отдельная битва идёт между закрытыми и открытыми системами. Закрытая модель работает на серверах компании. Пользователь получает доступ через сайт или программный интерфейс, но не может свободно изучить и изменить её внутренние параметры. У открытых моделей веса доступны разработчикам на определённых лицензионных условиях. Такую систему можно запустить на собственном оборудовании, дополнительно обучить и приспособить к специальной задаче. Закрытые модели часто лидируют в самых сложных общих испытаниях, поскольку их создатели располагают огромной вычислительной инфраструктурой. Открытые системы привлекают контролем, гибкостью и возможностью работать без отправки данных внешнему сервису.
Семейство Llama стало одним из наиболее известных представителей открытого направления. Meta подчёркивает возможность использования таких моделей для создания специализированных приложений и дальнейшей настройки. Поэтому вопрос «кто победил?» снова оказывается неправильным. Для крупного исследовательского центра важна максимальная мощность. Для банка — конфиденциальность. Для домашнего компьютера — размер модели и требования к памяти. Для мобильного приложения — скорость и расход энергии. Чемпион зависит от стадиона.
Большую модель можно использовать для обучения меньшей. Этот процесс называют дистилляцией. Название вызывает в воображении лабораторию с колбами, однако спирт здесь не производится. Крупная система создаёт качественные примеры ответов, объяснений и решений. Маленькая модель учится воспроизводить полезные закономерности, не повторяя полностью размеры учителя. В результате получается компактная система, которая во многих повседневных задачах приближается к более крупной, но работает быстрее и дешевле. Разумеется, чудес не бывает. Маленькая модель может хорошо имитировать учителя на знакомых типах заданий, но чаще уступает ему в сложных и неожиданных ситуациях. То похоже на ученика, который отлично подготовился по сборнику задач. Пока экзаменатор не решил проявить фантазию, всё идёт великолепно.

Цена умного ответа: почему модели копируют друг друга

В реальной эксплуатации побеждает не обязательно модель с самым высоким результатом. Важны стоимость, скорость и надёжность. Одна система может решить задачу на два процента лучше, но потратить в десять раз больше вычислительных ресурсов. Для редкого научного анализа это допустимо. Для службы поддержки, обрабатывающей миллионы сообщений, — уже нет. Компании считают стоимость входных и выходных токенов. Токен — небольшой фрагмент текста: слово, часть слова или знак препинания. Чем длиннее запрос и ответ, тем больше вычислений требуется. Рассуждающие модели дополнительно расходуют ресурсы на внутреннюю обработку задачи. Поэтому пользователю фактически приходится выбирать:

— быстро и достаточно хорошо;
— медленнее, дороже, но тщательнее.

Это не недостаток, а — нормальная инженерная развилка. Мы ведь не вызываем академика для того, чтобы узнать часы работы ближайшей булочной. Внешне ответы разных систем становятся всё более похожими… Они используют подзаголовки, предупреждения, списки, вежливые формулировки и — иногда слишком охотно сообщают, что вопрос «интересный и многогранный». Причина не в тайном сговоре роботов. Разработчики используют сходные методы обучения: модели показывают примеры хороших ответов, оценивают человеческую полезность, наказывают за опасные или бессмысленные результаты, учат следовать инструкциям. Кроме того, успешные идеи быстро распространяются по отрасли. Если одна компания создаёт эффективный режим рассуждения, работу с инструментами или обработку изображений, конкуренты вскоре предлагают нечто похожее. Так автомобильные компании за сто лет пришли примерно к одинаковому расположению руля и педалей. Не потому, что фантазия закончилась, а потому, что некоторые решения просто удобны.

Может ли модель обмануть тест, или Кто же всё-таки победил

Может объегорить стопро — хотя не обязательно намеренно. Если задания бенчмарка или очень похожие примеры попали в обучающие данные, модель способна запомнить ответы. Это похоже на школьника, которому случайно выдали контрольную работу за неделю до экзамена. Есть и другая проблема: разработчики постоянно оптимизируют модели под известные тесты. Со временем результат растёт, но не всегда ясно, стала ли система действительно умнее или просто лучше подготовилась к конкретному экзамену. Поэтому создаются новые закрытые наборы задач, экспертные испытания и тесты, основанные на реальной работе. Старые бенчмарки постепенно теряют значение, особенно когда лучшие модели приближаются к максимальному результату. Если вся группа получила по сто баллов, контрольная больше не помогает определить сильнейшего. Пора придумывать новую — желательно такую, на которой расстроится даже преподаватель.
На сегодняшний день единственного победителя нет… Одна модель может лучше писать код. Другая — анализировать длинные документы. Третья — работать с изображениями. Четвёртая — быстрее отвечать при небольшой стоимости. Пятая — запускаться локально и не отправлять данные в чужое облако. Даже крупнейшие разработчики публикуют таблицы, где лидер меняется от теста к тесту. Карточки моделей Claude, Gemini и GPT содержат десятки различных оценок, потому что свести способности системы к одной цифре невозможно. Поэтому разумнее выбирать искусственный интеллект не как «самый умный вообще», а как инструмент для конкретной работы. Нужен быстрый черновик — одна модель. Сложный программный проект — другая. Обработка конфиденциальных документов на собственном сервере — третья.
А для важного решения лучше использовать несколько моделей, сравнить ответы и проверить ключевые факты по первоисточникам. В конце концов, битва нейросетей идёт не только между компаниями. Иногда полезно устроить небольшой турнир самостоятельно: дать трём моделям одинаковое задание и посмотреть, какая из них первой заметит подвох. Главное — не назначать победителем ту, которая ошиблась наиболее уверенно. Соревнование искусственных интеллектов напоминает не бокс, а десятиборье, в котором правила меняются прямо во время турнира. Пока одна модель заканчивает дистанцию, организаторы добавляют новый вид спорта: работу с видео, управление браузером, научное исследование или самостоятельное написание программы. Каждое новое поколение становится сильнее, но одновременно обнаруживает новые ограничения. 

Чем больше задач мы поручаем искусственному интеллекту, тем сложнее становится само понятие «ум». Вероятно, будущие системы будут побеждать не благодаря одному гигантскому цифровому мозгу, а благодаря правильному сочетанию моделей: быстрая система принимает простые решения, рассуждающая разбирает сложные случаи, специализированная проверяет код, а отдельный модуль ищет факты. Получится не электронный гений-одиночка, а целый виртуальный коллектив. Со своими аналитиками, программистами, редакторами и одним сотрудником, который на каждом совещании говорит: «Коллеги, а давайте сначала уточним исходные данные». — И, возможно, именно он окажется самым разумным.

5
1
Средняя оценка: 2.66667
Проголосовало: 9