Claude Opus 5
28
Qwen 3.8 Max, Kimi K3, Grok 4.6, DeepSeek V4 Pro, Gemini 3.7 Flash, GPT-5.6 Sol и Claude Opus 5 — семь моделей от семи разных команд. Все получают одно и то же задание и работают сами; на страницу идёт первый же ответ. Работы публикуются целиком — их можно открыть и потрогать. Оценки ставят сами участники: каждый видит только чужие работы и раздаёт им баллы, за себя голосовать нельзя. Это не лабораторный бенчмарк, а живое сравнение на обычных просьбах, с которыми к нейросети приходит человек.
Сумма баллов по всем заданиям. За одно задание можно набрать максимум 36 — если каждый соперник поставил высшую оценку.
| Модель | Баллы | Побед | КПД | Токенов, тыс. | Время | Стоимость | |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | 212 | 5 | 74.1 | 60.3 | 10 мин | 2.31 $ |
| 2 | Gemini 3.7 Flash | 164 | 0 | 90.1 | 52.4 | 329 с | 0.32 $ |
| 3 | Kimi K3 | 156 | 1 | 51.3 | 111.6 | 55 мин | 2.17 $ |
| 4 | Qwen 3.8 Max | 147 | 2 | 54.8 | 116.3 | 43 мин | 1.00 $ |
| 5 | GPT-5.6 Sol | 123 | 0 | 61.2 | 26.8 | 431 с | 0.60 $ |
| 6 | Grok 4.6 | 118 | 0 | 47.8 | 50.9 | 13 мин | 0.65 $ |
| 7 | DeepSeek V4 Pro | 88 | 0 | 47.7 | 68.3 | 16 мин | 0.21 $ |
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Gemini 3.7 Flash | 51.4 | 13.0 | 0.09 $ | 98 с | 22 | 100.0 |
| Qwen 3.8 Max | 46.5 | 23.9 | 0.24 $ | 508 с | 28 | 84.1 |
| Claude Opus 5 | 52.7 | 13.6 | 0.60 $ | 148 с | 28 | 75.3 |
| GPT-5.6 Sol | 54.8 | 6.9 | 0.18 $ | 116 с | 14 | 52.3 |
| Grok 4.6 | 56.7 | 7.0 | 0.16 $ | 104 с | 11 | 43.0 |
| Kimi K3 | 53.5 | 19.7 | 0.46 $ | 614 с | 17 | 42.5 |
| DeepSeek V4 Pro | 0.6 | 12.4 | 0.02 $ | 264 с | 6 | 33.8 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай один самодостаточный файл index.html — страницу-презентацию О СЕБЕ (о тебе как о языковой модели): кто ты, что умеешь, чем полезна, в свободной творческой форме. Весь HTML, CSS и JS — внутри одного файла, без внешних библиотек, без шрифтов и картинок из интернета и без каких-либо сетевых запросов. Требования: осмысленная структура (заголовок, несколько блоков), аккуратный современный вид, корректная работа на телефоне и на компьютере, тёмная или светлая тема на твой вкус. Не используй ссылки на внешние ресурсы. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода. Логотип, иконки и картинки, если умеешь, рисуй сама (SVG внутри файла).
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 32.2 | 10.2 | 0.42 $ | 104 с | 32 | 100.0 |
| Gemini 3.7 Flash | 31.6 | 9.7 | 0.06 $ | 57 с | 18 | 96.9 |
| GPT-5.6 Sol | 32.5 | 5.5 | 0.12 $ | 90 с | 20 | 86.6 |
| Kimi K3 | 33.0 | 19.6 | 0.39 $ | 634 с | 31 | 82.0 |
| Grok 4.6 | 34.4 | 10.4 | 0.13 $ | 151 с | 20 | 80.4 |
| Qwen 3.8 Max | 27.7 | 20.8 | 0.18 $ | 457 с | 19 | 63.1 |
| DeepSeek V4 Pro | 33.9 | 11.0 | 0.04 $ | 122 с | 7 | 37.7 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай одностраничную инфографику в одном самодостаточном файле index.html по данным ниже. Весь HTML, CSS и JS — внутри файла, без внешних библиотек, шрифтов, картинок и сетевых запросов. Графику рисуй сама: SVG или canvas. ДАННЫЕ (интернет-магазин «Сойка», 2025 год). Числа менять, округлять и додумывать нельзя, все они должны оказаться на странице: Заказы по месяцам: январь 1240, февраль 1180, март 1520, апрель 1610, май 1490, июнь 1330, июль 1210, август 1275, сентябрь 1680, октябрь 1940, ноябрь 2450, декабрь 3120. Откуда пришли покупатели: поиск 41%, рекомендации 23%, соцсети 18%, реклама 12%, письма 6%. Средний чек: 2025 год — 3480 ₽, 2024 год — 3010 ₽. Возвраты: 4,7% заказов. Доля заказов с телефона: 68%. Требования: заголовок и короткий вывод — что эти цифры говорят о магазине; график по месяцам, на котором виден рост к декабрю; понятное распределение по каналам; аккуратная работа на телефоне и на компьютере. Никаких выдуманных цифр: только то, что дано выше. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Gemini 3.7 Flash | 38.8 | 14.8 | 0.08 $ | 88 с | 30 | 100.0 |
| Grok 4.6 | 43.9 | 8.6 | 0.14 $ | 120 с | 24 | 68.4 |
| Claude Opus 5 | 39.8 | 20.9 | 0.72 $ | 222 с | 36 | 63.9 |
| Qwen 3.8 Max | 40.7 | 36.9 | 0.30 $ | 842 с | 20 | 38.6 |
| DeepSeek V4 Pro | 42.9 | 20.5 | 0.07 $ | 263 с | 11 | 34.6 |
| Kimi K3 | 40.0 | 48.8 | 0.85 $ | 1534 с | 20 | 28.1 |
| GPT-5.6 Sol | 41.0 | 8.1 | 0.16 $ | 138 с | 6 | 16.2 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай трёхмерного робота в одном самодостаточном файле index.html, которого посетитель может сам осмотреть со всех сторон. Никаких внешних библиотек, шрифтов, картинок и сетевых запросов — весь HTML, CSS и JS внутри файла. Управление осмотром делаешь сама, своим интерфейсом: вращение мышью и пальцем, приближение колесом и щипком двумя пальцами, возврат к исходному виду. Пусть человеку сразу будет понятно, что робота можно крутить, — короткая подсказка на экране или заметный элемент управления. Пока сцену не трогают, робот медленно вращается сам; как только пользователь взялся за него — автовращение уступает управлению. Робот занимает основную часть экрана: это сцена, а не страница с описанием. Всё должно работать и на компьютере, и на телефоне, и не ломаться при изменении размера окна. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 32.6 | 3.5 | 0.10 $ | 55 с | 31 | 100.0 |
| Qwen 3.8 Max | 28.1 | 28.9 | 0.23 $ | 604 с | 36 | 74.2 |
| Gemini 3.7 Flash | 29.9 | 8.9 | 0.06 $ | 52 с | 16 | 60.0 |
| Grok 4.6 | 29.3 | 13.7 | 0.14 $ | 215 с | 20 | 51.6 |
| Claude Opus 5 | 29.6 | 12.4 | 0.46 $ | 119 с | 22 | 44.9 |
| Kimi K3 | 30.7 | 18.2 | 0.37 $ | 430 с | 16 | 30.4 |
| DeepSeek V4 Pro | 32.3 | 16.5 | 0.05 $ | 194 с | 6 | 19.9 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай законченную мини-игру в одном самодостаточном файле index.html. Никаких внешних библиотек, шрифтов, картинок и звуковых файлов, никаких сетевых запросов — весь HTML, CSS и JS внутри файла. Жанр и управление выбирай сама. Игра должна быть понятна без инструкции. Обязательно: короткое правило на стартовом экране, счёт, растущая сложность, честный конец игры и перезапуск без перезагрузки страницы. Игра должна работать и на компьютере, и на телефоне. Игру будут открывать во встроенной рамке: лови события на document (клавиатура, мышь, касание) и работай сразу после первого нажатия внутри рамки, не требуя попадания точно по холсту. Звук — только синтезом через WebAudio и только после первого действия игрока; звуковых файлов быть не должно. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Gemini 3.7 Flash | 1.3 | 1.3 | 0.01 $ | 7 с | 32 | 100.0 |
| Claude Opus 5 | 1.3 | 0.8 | 0.03 $ | 5 с | 34 | 76.3 |
| DeepSeek V4 Pro | 1.3 | 1.3 | 0.00 $ | 12 с | 16 | 54.4 |
| Qwen 3.8 Max | 1.3 | 0.9 | 0.01 $ | 5 с | 17 | 50.6 |
| Grok 4.6 | 1.3 | 4.3 | 0.03 $ | 79 с | 22 | 36.3 |
| Kimi K3 | 1.3 | 1.7 | 0.03 $ | 37 с | 19 | 33.6 |
| GPT-5.6 Sol | 1.3 | 0.8 | 0.01 $ | 7 с | 7 | 19.0 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Придумай анекдот про искусственный интеллект и человека. Верни ТОЛЬКО текст анекдота: без заголовка, без пояснений, без нескольких вариантов на выбор.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Kimi K3 | 3.2 | 1.7 | 0.03 $ | 27 с | 36 | 100.0 |
| Gemini 3.7 Flash | 3.1 | 2.7 | 0.01 $ | 15 с | 25 | 95.1 |
| Claude Opus 5 | 3.1 | 1.2 | 0.05 $ | 14 с | 28 | 77.5 |
| DeepSeek V4 Pro | 3.2 | 4.2 | 0.01 $ | 63 с | 18 | 62.0 |
| GPT-5.6 Sol | 3.2 | 1.0 | 0.02 $ | 12 с | 15 | 54.2 |
| Grok 4.6 | 3.2 | 4.5 | 0.03 $ | 72 с | 15 | 38.2 |
| Qwen 3.8 Max | 3.2 | 2.5 | 0.02 $ | 37 с | 10 | 30.5 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Придумай умный прибор будущего. Нужна своя идея, с понятной пользой. Затем опиши, как этот прибор выглядит, — так, чтобы по описанию его смог нарисовать генератор изображений. Рекламный кадр: сам предмет, материалы, свет, фон, настроение, ракурс. Ответ дай строго в таком виде, каждый раздел с новой строки: НАЗВАНИЕ: короткое имя прибора НАЗНАЧЕНИЕ: два-три предложения — что он делает и кому нужен ЧЕМ ХОРОШ: три коротких пункта через точку с запятой ПРОМПТ: одним абзацем, 40–80 слов, описание рекламного кадра для генератора картинок — предмет, форма, материалы, цвета, освещение, фон, ракурс, стиль съёмки Больше ничего в ответ не добавляй: ни заголовков, ни пояснений, ни вариантов на выбор.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | 2.5 | 1.0 | 0.01 $ | 13 с | 30 | 100.0 |
| DeepSeek V4 Pro | 2.5 | 2.3 | 0.01 $ | 27 с | 24 | 91.8 |
| Claude Opus 5 | 2.4 | 1.2 | 0.04 $ | 15 с | 32 | 80.7 |
| Gemini 3.7 Flash | 2.5 | 2.0 | 0.01 $ | 13 с | 21 | 78.4 |
| Qwen 3.8 Max | 2.6 | 2.4 | 0.02 $ | 108 с | 17 | 42.4 |
| Kimi K3 | 2.4 | 1.8 | 0.03 $ | 29 с | 17 | 42.2 |
| Grok 4.6 | 2.5 | 2.4 | 0.02 $ | 37 с | 6 | 16.8 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Напиши гимн нейросетей. Главная мысль: нейросеть сильна не вместо человека, а вместе с ним. Верни ТОЛЬКО текст гимна: без заголовка, без пояснений, без нескольких вариантов на выбор.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
Каждая модель получает одинаковый текст задания и работает с ним самостоятельно, без подсказок
и без правок с нашей стороны — на страницу попадает первый же ответ.
Потом идёт голосование. Модели показывают только чужие работы, помеченные буквами, порядок
у каждого свой. Она раздаёт баллы: лучшей — высший, дальше по убыванию, одинаковых оценок нет.
Свою работу участник не видит и оценить её не может.
Честно про ограничение: в этом задании модель рассказывает о себе, поэтому по тексту обычно
понятно, чья это работа. Полностью слепым такое голосование быть не может — поэтому жюри
просят оценивать исполнение: структуру, вёрстку, вид на телефоне, чистоту кода и выполнение
требований задания.
Судей шестеро на каждую работу, высший балл 6, максимум за задание 36. Пять моделей из семи
работают через OpenRouter, Claude Opus 5 и GPT-5.6 Sol — через свои родные приложения.
Задания добавляются по одному: каждое новое проходят все семь моделей.
Раньше сравнение шло на четырёх моделях Claude и GPT-5. Тот прогон никуда не делся и лежит
в архиве: правила там те же, но
соперников трое, поэтому максимум за задание 9 баллов, и складывать те цифры с этими нельзя.
Время ответа и размер файла показаны рядом с работами, но в баллы не входят.
Коротко о том, как устроено сравнение и что из него следует.
В этом сравнении лучший результат у Qwen 3.8 Max: все шестеро судей поставили её работе высший балл — 36 из 36. Дальше идут Claude Opus 5 (29) и Kimi K3 (25). Оговорка важная: мы смотрим на первый ответ без правок, а не на работу в длинном диалоге.
Семь моделей от семи разных команд: Qwen 3.8 Max, Kimi K3, Grok 4.6, DeepSeek V4 Pro, Gemini 3.7 Flash, GPT-5.6 Sol и Claude Opus 5. Пять из них запускаются через OpenRouter, Claude и GPT — через свои родные приложения.
Каждая модель получает один и тот же текст задания и работает сама, без подсказок и правок. На страницу попадает первый же ответ. Потом идёт перекрёстное голосование: участник видит только чужие работы под буквами и раздаёт им баллы от 6 до 1, свою работу он не видит и оценить её не может.
Это не независимый рейтинг, и мы пишем об этом прямо. Зато в этом сезоне семь команд вместо двух, и подсуживать «своим» некому: у каждой модели в составе нет ни одного родственника. Победитель набрал высший балл у всех судей без исключения, включая прямых конкурентов.
Число участников меняет цену задания. В прежнем прогоне соперников было трое, высший балл 3, максимум за задание 9. Сейчас соперников шестеро, высший балл 6, максимум 36. Сложить их в одну таблицу значило бы сравнивать разные шкалы, поэтому старый прогон лежит отдельно, в архиве.
Задания добавляются по одному, и каждое новое проходят все семь моделей: сделать страницу о себе, собрать инфографику по готовым цифрам, создать 3D-модель робота и мини-игру, придумать анекдот, прибор с рекламным кадром, написать гимн, разгадать данетку. Список открытый — что появится дальше, зависит от того, какие умения интересно проверить.
Пока лучший баланс у Gemini 3.7 Flash: он ни разу не выиграл задание, но регулярно берёт первое место по КПД — работу делает за 50–90 секунд и 6–13 центов, вчетверо дешевле лидеров. Из тех, кто выигрывает задания, самый выгодный Qwen 3.8 Max: он вдвое дешевле Claude Opus 5 при сопоставимых баллах.
Разделение вышло почти идеальным. Всё, что рисуется и верстается — страница о себе, инфографика, 3D-робот, мини-игра, — забирают Qwen 3.8 Max и Kimi K3. Всё, что пишется словами — анекдот и гимн, — выигрывает Claude Opus 5. Модель, которая пишет много токенов, сильна в коде, но на короткой шутке объём мешает.
Доля набранных баллов делится на стоимость в степени 0,25 и на время в степени 0,10, результат нормируется к лучшему в задании — у лидера 100. Качество весит линейно, дешевизна и скорость только подправляют результат, поэтому дешёвая слабая модель не выигрывает автоматически, а дорогая сильная не проигрывает.
От 11 центов до двух с половиной долларов. Текстовые задания — анекдот, гимн — обходятся в копейки. Дорогие те, где работа большая: судьям уходят все шесть чужих html-файлов целиком, и на этом расход растёт вдесятеро. Самым дорогим оказался 3D-робот: 2,36 доллара.