Российские ИИ обошли зарубежные. Где именно — зависит от строки в таблице

Осталось совсем немного для превращения этой формулы в содержательное сравнение: назвать направления, соперников и показать таблицу целиком.

Российские модели искусственного интеллекта конкурируют с зарубежными и по отдельным направлениям их превосходят, заявил вице-премьер Дмитрий Григоренко. Формулировка звучит почти как результат технологической гонки, но в опубликованном сообщении не названы ни победившая модель, ни проигравшая, ни само направление, ни тест, на котором определялся победитель.

— Наши модели конкурируют с иностранными и по отдельным направлениям выигрывают у иностранных моделей, — заявил Григоренко.

Он также отметил, что отечественными моделями искусственного интеллекта пользуется больше половины российских граждан, и назвал это показателем их качества. В опубликованном материале «Вестей», однако, не указано, на основании какого исследования получена эта доля, кого именно считали пользователем и какие российские сервисы вошли в подсчёт.

Сама по себе популярность тоже не является тестом качества нейросети. На число пользователей влияют доступность сервиса, его встроенность в другие продукты, цена, язык, корпоративное внедрение и множество других обстоятельств. Миллионы людей пользуются калькулятором в телефоне, но чемпионат калькуляторов по этому показателю обычно не проводят. При этом первую часть заявления Григоренко вполне можно подтвердить. Например, опубликованная карточка GigaChat 3.5 Reasoning показывает, что российская модель обходит DeepSeek V4 Flash Preview Reasoning в ряде испытаний. В математическом AIME 2026 результат составляет 92 против 90,4, в IFBench — 77 против 73,33, в StructEval — 85 против 80,19.

Но достаточно прокрутить ту же таблицу немного дальше. В HMMT 2025 уже лидирует DeepSeek — 95,21 против 83,13, в GPQA Diamond — 87,4 против 82,32, в SWE-bench Verified — 78,6 против 64,7, а в Terminal-Bench 2 — 56,6 против 30,3. Средний результат всех приведённых испытаний составляет 72,71 у DeepSeek и 68,88 у GigaChat. Получается почти идеальная демонстрация официальной формулы. Фраза «по отдельным направлениям выигрывают» совершенно верна. Ровно так же из той же таблицы совершенно верно следует, что по средней оценке выбранный зарубежный конкурент оказался впереди.

Есть и открытый русскоязычный бенчмарк MERA 2.0. На момент проверки GigaChat 3.5 Reasoning занимает в его общем рейтинге 13-е место с результатом 0,423. Первое место занимает Gemini 3.7 Flash с 0,678, второе — GPT-5.6 Sol с 0,639, третье — Claude Opus 5 с 0,631. Причём MERA проверяет в том числе работу с русским языком, культурным контекстом, рассуждениями и следованием инструкциям.

Есть и хорошие новости. У «Яндекса», например, YandexGPT 5.1 Pro по внутреннему слепому сравнению компании выигрывает у GPT-4.1 (достаточно сильно устаревшая модель Open Ai) в 56% запросов. В отдельных стандартизированных тестах российская модель также показывает результаты на уровне зарубежных конкурентов или выше. Но здесь опять появляются необходимые слова: конкретная модель, конкретный соперник, конкретная методика и конкретные задачи.

Российские нейросети действительно способны выигрывать у зарубежных «по отдельным направлениям». Осталось совсем немного для превращения этой формулы в содержательное сравнение: назвать направления, соперников и показать таблицу целиком. После этого технологическая гонка становится несколько менее торжественной, зато заметно более измеримой.

Максим Рокатанский





О РЕКЛАМЕ О ПРОЕКТЕ НАПИСАТЬ ЖАЛОБУ

© «БрянскТоdау» 2022. All rights reserved. Возрастная категория сайта: 18+