Matreshka

Matrena

Матрёна — самая сильная российская модель. На этой странице — её результаты и сравнение с Gemini 3.8 Flash, Opus 5, GigaChat 3.5, Алисой и GPT-5.6.

Смотреть результаты

Матрёна в цифрах

Три результата из открытого сравнения. Ниже — полная таблица, диаграммы и пояснения к испытаниям.

SWE-bench Verified
79.0%
Terminal-bench 2.1
91.4%
τ2 Telecom
95.0%

Что можно поручить Matrena

Пришлите материал или опишите задачу. Matrena разберётся и поможет получить готовый результат.

Слушает и смотрит

Разбирает аудио, расшифровывает звонки и помогает работать с видео.

Находит информацию

Ищет в интернете и собирает нужные сведения для задачи.

Готовит документы

Работает с таблицами и Word, собирает готовые PDF.

Пишет скрипты

Решает конкретные подзадачи и помогает автоматизировать работу.

Рядом с другими моделями

Лучший опубликованный результат в каждой строке выделен. Прочерк означает, что данных нет, а не нулевой результат.

Сравнение Matrena с Gemini 3.8 Flash, Opus 5, GigaChat 3.5, Алисой и GPT-5.6
MatrenaGemini 3.8 FlashOpus 5GigaChat 3.5АлисаGPT-5.6
SWE-bench VerifiedИсправление ошибок в реальных проектах79.0%80.0%96.0%42.6%-82.2%
Terminal-bench 2.0Задачи в терминале · версия 2.089.0%89.4%89.1%13.5%-91.9%
Terminal-bench 2.1Задачи в терминале · версия 2.191.4%89.4%89.1%--88.8%
τ2 TelecomДиалог и работа с инструментами95.0%--68.7%--
MCP AtlasЗадачи с подключёнными инструментами72.0%-----
OSWorldРабота в графических приложениях61.0%59.0%75.4%--62.6%
GPQA DiamondСложные вопросы по естественным наукам88.1%95.3%93.2%61.1%-94.6%

Результаты на одной шкале

Каждая диаграмма показывает одно испытание от 0 до 100%. Место Matrena считается только среди моделей с опубликованным результатом.

SWE-bench Verified

Место Matrena: 4 из 5
79.0%
Matrena
80.0%
Gemini 3.8 Flash
96.0%
Opus 5
42.6%
GigaChat 3.5
-
Алиса
82.2%
GPT-5.6

Terminal-bench 2.0

Место Matrena: 4 из 5
89.0%
Matrena
89.4%
Gemini 3.8 Flash
89.1%
Opus 5
13.5%
GigaChat 3.5
-
Алиса
91.9%
GPT-5.6

Terminal-bench 2.1

Место Matrena: 1 из 4
91.4%
Matrena
89.4%
Gemini 3.8 Flash
89.1%
Opus 5
-
GigaChat 3.5
-
Алиса
88.8%
GPT-5.6

τ2 Telecom

Место Matrena: 1 из 2
95.0%
Matrena
-
Gemini 3.8 Flash
-
Opus 5
68.7%
GigaChat 3.5
-
Алиса
-
GPT-5.6

MCP Atlas

Опубликован только результат Matrena
72.0%
Matrena
-
Gemini 3.8 Flash
-
Opus 5
-
GigaChat 3.5
-
Алиса
-
GPT-5.6

OSWorld

Место Matrena: 3 из 4
61.0%
Matrena
59.0%
Gemini 3.8 Flash
75.4%
Opus 5
-
GigaChat 3.5
-
Алиса
62.6%
GPT-5.6

GPQA Diamond

Место Matrena: 4 из 5
88.1%
Matrena
95.3%
Gemini 3.8 Flash
93.2%
Opus 5
61.1%
GigaChat 3.5
-
Алиса
94.6%
GPT-5.6

Прочерк на диаграмме означает отсутствие опубликованного результата.

Методика

Результаты Matrena — наши прогоны; результаты других моделей — публичные отчёты. Условия прогонов могут различаться. Диаграммы повторяют числа из таблицы. Прочерк означает отсутствие публикации, а не 0%.

SWE-bench Verified

Реальные задачи из программных проектов: агент читает описание проблемы и вносит исправление в код.

Terminal-bench

Задачи в командной строке: настройка окружения, анализ данных и работа с файлами. Версии 2.0 и 2.1 показаны отдельно. Для версии 2.1 внешние результаты взяты из сравнения с агентом Terminus 2; GPT-5.6 здесь означает Sol.

Работа с инструментами

τ2 Telecom проверяет диалог с пользователем и работу с инструментами в задачах связи. MCP Atlas — работу с внешними инструментами через MCP.

OSWorld

Задачи в графических программах на компьютере: найти нужное, внести изменения и получить результат.

GPQA Diamond

Сложные вопросы по физике, химии и биологии, составленные специалистами.

По ARC-AGI-2, MMMU и MMMLU в этой таблице нет публикаций ни у одной сравниваемой модели.

Matrena

Матрёна — самая сильная российская модель.