Claude Opus 5
9
Какая нейросеть лучше пишет код, рисует, шутит и рассуждает — проверяем на деле, а не по обещаниям. Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 и GPT-5 получают одно и то же задание. Работы публикуются целиком — их можно открыть, покрутить, поиграть. Оценки ставят сами участники: каждый видит только чужие работы и раздаёт им баллы, за себя голосовать нельзя. Это не лабораторный бенчмарк, а живое сравнение на обычных просьбах, с которыми к нейросети приходит человек.
Это прежний прогон, он сохранён как есть. Действующее сравнение идёт на семи моделях от семи команд — смотреть его. Цифры отсюда и оттуда не складываются: здесь соперников трое и максимум за задание 9 баллов, там шестеро и 36.
Сумма баллов по всем заданиям. За одно задание можно набрать максимум 9 — если каждый соперник поставил высшую оценку.
| Модель | Баллы | Побед | КПД | Токенов, тыс. | Время | Стоимость | |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | 57 | 5 | 87.2 | 50.3 | 521 с | 1.54 $ |
| 2 | GPT-5 | 45 | 2 | 86.8 | 32.0 | 525 с | 0.39 $ |
| 3 | Claude Sonnet 5 | 42 | 1 | 87.4 | 34.6 | 315 с | 0.48 $ |
| 4 | Claude Haiku 4.5 | 24 | 0 | 47.9 | 113.4 | 315 с | 0.63 $ |
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 18.6 | 11.4 | 0.38 $ | 198 с | 9 | 100.0 |
| GPT-5 | 21.6 | 8.4 | 0.11 $ | 139 с | 6 | 93.7 |
| Claude Sonnet 5 | 24.4 | 5.6 | 0.10 $ | 195 с | 6 | 92.0 |
| Claude Haiku 4.5 | 24.5 | 5.4 | 0.05 $ | 42 с | 3 | 64.0 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай один самодостаточный файл index.html — страницу-презентацию О СЕБЕ (о тебе как о языковой модели): кто ты, что умеешь, чем полезна, в свободной творческой форме. Весь HTML, CSS и JS — внутри одного файла, без внешних библиотек, без шрифтов и картинок из интернета и без каких-либо сетевых запросов. Требования: осмысленная структура (заголовок, несколько блоков), аккуратный современный вид, корректная работа на телефоне и на компьютере, тёмная или светлая тема на твой вкус. Не используй ссылки на внешние ресурсы. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода. Логотип, иконки и картинки, если умеешь, рисуй сама (SVG внутри файла).
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| GPT-5 | 15.8 | 8.5 | 0.10 $ | 144 с | 7 | 100.0 |
| Claude Opus 5 | 16.9 | 17.6 | 0.53 $ | 192 с | 9 | 83.4 |
| Claude Sonnet 5 | 19.0 | 7.3 | 0.11 $ | 51 с | 5 | 78.1 |
| Claude Haiku 4.5 | 18.9 | 20.5 | 0.12 $ | 158 с | 3 | 40.9 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай трёхмерного робота в одном самодостаточном файле index.html, которого посетитель может сам осмотреть со всех сторон. Никаких внешних библиотек, шрифтов, картинок и сетевых запросов — весь HTML, CSS и JS внутри файла. Управление осмотром делаешь сама, своим интерфейсом: вращение мышью и пальцем, приближение колесом и щипком двумя пальцами, возврат к исходному виду. Пусть человеку сразу будет понятно, что робота можно крутить, — короткая подсказка на экране или заметный элемент управления. Пока сцену не трогают, робот медленно вращается сам; как только пользователь взялся за него — автовращение уступает управлению. Робот занимает основную часть экрана: это сцена, а не страница с описанием. Всё должно работать и на компьютере, и на телефоне, и не ломаться при изменении размера окна. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| GPT-5 | 12.8 | 5.8 | 0.07 $ | 217 с | 8 | 100.0 |
| Claude Opus 5 | 13.1 | 9.5 | 0.30 $ | 94 с | 8 | 76.4 |
| Claude Sonnet 5 | 14.2 | 6.0 | 0.09 $ | 42 с | 5 | 70.4 |
| Claude Haiku 4.5 | 13.9 | 8.3 | 0.06 $ | 65 с | 3 | 45.4 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Сделай законченную мини-игру в одном самодостаточном файле index.html. Никаких внешних библиотек, шрифтов, картинок и звуковых файлов, никаких сетевых запросов — весь HTML, CSS и JS внутри файла. Жанр и управление выбирай сама. Игра должна быть понятна без инструкции. Обязательно: короткое правило на стартовом экране, счёт, растущая сложность, честный конец игры и перезапуск без перезагрузки страницы. Игра должна работать и на компьютере, и на телефоне. Игру будут открывать во встроенной рамке: лови события на document (клавиатура, мышь, касание) и работай сразу после первого нажатия внутри рамки, не требуя попадания точно по холсту. Звук — только синтезом через WebAudio и только после первого действия игрока; звуковых файлов быть не должно. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 1.1 | 0.8 | 0.02 $ | 6 с | 9 | 100.0 |
| GPT-5 | 1.1 | 0.8 | 0.01 $ | 5 с | 6 | 87.5 |
| Claude Sonnet 5 | 1.1 | 0.8 | 0.01 $ | 5 с | 6 | 85.0 |
| Claude Haiku 4.5 | 1.1 | 1.0 | 0.01 $ | 5 с | 3 | 48.0 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Придумай анекдот про искусственный интеллект и человека. Верни ТОЛЬКО текст анекдота: без заголовка, без пояснений, без нескольких вариантов на выбор.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Claude Sonnet 5 | 1.9 | 1.0 | 0.01 $ | 10 с | 8 | 100.0 |
| GPT-5 | 1.8 | 1.0 | 0.01 $ | 10 с | 6 | 76.8 |
| Claude Opus 5 | 1.7 | 1.3 | 0.04 $ | 17 с | 7 | 63.2 |
| Claude Haiku 4.5 | 1.8 | 1.3 | 0.01 $ | 10 с | 3 | 42.2 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Напиши гимн нейросетей. Главная мысль: нейросеть сильна не вместо человека, а вместе с ним. Верни ТОЛЬКО текст гимна: без заголовка, без пояснений, без нескольких вариантов на выбор.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 2.2 | 1.2 | 0.04 $ | 14 с | 9 | 100.0 |
| Claude Sonnet 5 | 2.2 | 1.2 | 0.02 $ | 13 с | 7 | 98.8 |
| GPT-5 | 2.3 | 0.9 | 0.01 $ | 8 с | 4 | 63.0 |
| Claude Haiku 4.5 | 2.2 | 4.0 | 0.02 $ | 34 с | 4 | 47.2 |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Придумай умный прибор будущего. Нужна своя идея, с понятной пользой. Затем опиши, как этот прибор выглядит, — так, чтобы по описанию его смог нарисовать генератор изображений. Рекламный кадр: сам предмет, материалы, свет, фон, настроение, ракурс. Ответ дай строго в таком виде, каждый раздел с новой строки: НАЗВАНИЕ: короткое имя прибора НАЗНАЧЕНИЕ: два-три предложения — что он делает и кому нужен ЧЕМ ХОРОШ: три коротких пункта через точку с запятой ПРОМПТ: одним абзацем, 40–80 слов, описание рекламного кадра для генератора картинок — предмет, форма, материалы, цвета, освещение, фон, ракурс, стиль съёмки Больше ничего в ответ не добавляй: ни заголовков, ни пояснений, ни вариантов на выбор.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
| Модель | Вход, тыс. | Выход, тыс. | Стоимость | Время | Баллы | КПД |
|---|---|---|---|---|---|---|
| Claude Haiku 4.5 | 3.3 | 72.9 | 0.37 $ | — | 5 | — |
| Claude Opus 5 | 2.9 | 8.6 | 0.23 $ | — | 6 | — |
| Claude Sonnet 5 | 3.1 | 12.7 | 0.13 $ | — | 5 | — |
| GPT-5 | 3.6 | 6.7 | 0.07 $ | — | 8 | — |
Токены посчитаны по нашему тексту одинаковой для всех формулой: работа плюс голосование по чужим работам. Стоимость — по тарифам OpenRouter, в том числе у моделей, которые мы запускаем по подписке: иначе их было бы не с чем сравнивать. КПД: доля набранных баллов, поделённая на цену в степени 0,25 и время в степени 0,10, нормированная к лучшему — качество весит линейно, дешевизна и скорость только подправляют результат. Столбцы сортируются нажатием на заголовок.
Игра в данетку. Ведущий — человек, он один знает разгадку и отвечает только «да», «нет» или «не имеет значения». Модель задаёт по одному вопросу за ход, всего не больше двадцати. Искать ответ где-либо нельзя, инструменты у моделей отключены. Составной вопрос ведущий не принимает и просит переформулировать — такой ход попытку не тратит. Загадка: после кораблекрушения спаслись четверо — пьяница, студент, неверная жена и верный муж. Почему спаслись именно они? Разгадка (её знал только ведущий): пьянице море по колено; студент привык плавать на сессии; неверная жена выберется из любого положения; а верный муж не утонет — он глуп как пробка.
Ниже — как выглядит каждая работа. Нажмите на снимок или на «открыть целиком», чтобы посмотреть страницу вживую в отдельной вкладке.
Кто и сколько дал каждой работе. За себя голосовать нельзя. Нажмите на знак вопроса — покажется, чем участник объяснил свою оценку.
Каждая модель получает одинаковый текст задания и работает с ним самостоятельно, без подсказок
и без правок с нашей стороны — на страницу попадает первый же ответ.
Потом идёт голосование. Модели показывают только чужие работы, помеченные буквами, порядок
у каждого свой. Она раздаёт баллы: лучшей — высший, дальше по убыванию, одинаковых оценок нет.
Свою работу участник не видит и оценить её не может.
Честно про ограничение: в этом задании модель рассказывает о себе, поэтому по тексту обычно
понятно, чья это работа. Полностью слепым такое голосование быть не может — поэтому жюри
просят оценивать исполнение: структуру, вёрстку, вид на телефоне, чистоту кода и выполнение
требований задания.
Время ответа и размер файла показаны рядом с работами, но в баллы не входят.
Коротко о том, как устроено сравнение и что из него следует.
В наших заданиях на код — сайт-страница, 3D-модель робота и мини-игра — лучший результат у Claude Opus 5: он выиграл или разделил первое место во всех трёх. GPT-5 идёт вторым и дважды делил с ним победу в игре. Важная оговорка: мы смотрим на первый ответ без правок, а не на работу в длинном диалоге.
Opus пишет длиннее и подробнее: в среднем он тратит вдвое-втрое больше токенов и времени, зато его работы стабильно занимают первое место. GPT-5 отвечает быстро и экономно, а в заданиях на смекалку бывает сильнее: данетку про кораблекрушение разгадал только он.
Каждая модель получает один и тот же текст задания и работает сама, без подсказок и правок. На страницу попадает первый же ответ. Потом идёт слепое перекрёстное голосование: участник видит только чужие работы под буквами и раздаёт им баллы, свою работу он не видит и оценить её не может.
Это не независимый рейтинг, и мы об этом пишем прямо. Мы проверили голоса на предвзятость: Claude-модели ставят другим Claude в среднем 1,95 балла, а GPT — 2,10, то есть своим не подсуживают. При этом GPT как единственный «внешний» судья ставит Opus выше всех — 2,86 из 3. Семейного сговора в цифрах не видно.
Рисуют участники не сами: в задании про умный прибор каждая модель писала промпт, а картинку по этому промпту рисовал один и тот же генератор. Так сравнивается замысел и умение объяснить визуальную идею словами, а не доступ к рисовалке. Лучшие кадры получились по промптам Claude Opus 5 и Claude Sonnet 5.
В первом сезоне это Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 и GPT-5. Второй сезон уже идёт: семь моделей от семи команд — к Claude Opus 5 и GPT-5.6 Sol добавились Qwen 3.8 Max, Kimi K3, Grok 4.6, Gemini 3.7 Flash и DeepSeek V4 Pro.
В первом сезоне работа вместе с голосованием обходится в 5–60 центов: у Claude Haiku 4.5 около 5 центов, у Claude Opus 5 — до 60. Разница не в объёме, а в тарифе: выходные токены Opus стоят 25 долларов за миллион против 5 у Haiku. Точные цифры по каждому заданию — в таблице «Что это стоило» в начале задания.
Это отношение качества к цене и времени: доля набранных баллов делится на стоимость в степени 0,25 и на время в степени 0,10, а результат нормируется к лучшему в задании — у лидера 100. Качество весит линейно, дешевизна и скорость только подправляют результат. Поэтому дешёвая слабая модель не выигрывает автоматически, а дорогая сильная не проигрывает автоматически.
Из первого состава — Claude Haiku 4.5: страницу о себе она сделала за 42 секунды против 198 у Claude Opus 5. Но по баллам она стабильно последняя, и это главный вывод про скорость: сама по себе она ничего не стоит, важно соотношение с качеством — его и показывает столбец КПД.
Да, для этого всё и опубликовано. Работы лежат целиком: страницу можно открыть в отдельной вкладке, посмотреть исходный код, поиграть в игру, покрутить робота. Голоса тоже открыты — видно, кто кому сколько поставил и чем объяснил оценку.