IKORG Русская версия

Archive: four models — Claude and GPT-5

Which AI writes better code, draws better, jokes better and reasons better — we check it in practice, not by promises. Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 and GPT-5 get exactly the same task. The results are published in full — you can open them, spin them, play them. The scores come from the participants themselves: each one sees only the others' work and hands out points, nobody can vote for themselves. This is not a laboratory benchmark but a live comparison on the ordinary requests people bring to a model.

This is the earlier run, kept as it was. The current comparison uses seven models from seven teams — see it here. The numbers do not add up across the two: three rivals and 9 points per task here, six rivals and 36 there.

Updated: August 30, 2026 Models: 4 Tasks: 7

Overall standings

Points summed over all tasks. A single task can bring at most 9 — if every rival gave the top score.

ModelPoints WinsEfficiencyTokens, k TimeCost
1 Claude Opus 5 57 5 87.2 50.3 521 s 1.54 $
2 GPT-5 45 2 86.8 32.0 525 s 0.39 $
3 Claude Sonnet 5 42 1 87.4 34.6 315 s 0.48 $
4 Claude Haiku 4.5 24 0 47.9 113.4 315 s 0.63 $

Tasks

1 Build a personal web pagewhich AI builds the best websites 1Claude Opus 5198 s+9 2Claude Sonnet 5195 s+6 2GPT-5139 s+6 Claude Haiku 4.542 s+3

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Claude Opus 5 18.6 11.4 0.38 $ 198 s 9 100.0
GPT-5 21.6 8.4 0.11 $ 139 s 6 93.7
Claude Sonnet 5 24.4 5.6 0.10 $ 195 s 6 92.0
Claude Haiku 4.5 24.6 5.4 0.05 $ 42 s 3 64.0

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Build a single self-contained index.html file — a presentation page ABOUT YOURSELF (about you as a language model): who you are, what you can do, how you are useful, in free creative form. All HTML, CSS and JS inside one file, no external libraries, no fonts or images from the internet, no network requests whatsoever. Requirements: meaningful structure (a heading, several blocks), a neat modern look, correct work on a phone and on a computer, dark or light theme — your choice. Do not use links to external resources. Return ONLY the contents of index.html, complete, in a single code block. Draw the logo, icons and pictures yourself if you can (SVG inside the file).

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 59
  • 3from GPT-5Самая цельная и сильная работа: современная адаптивная вёрстка, много содержательных секций, интерактивность, SVG-графика, тёмная/светлая тема и полная самодостаточность без внешних запросов.
  • 3from Claude Haiku 4.5Самая полная реализация: 6+ проработанных секций, обе темы (тёмная и светлая), высокий уровень интерактивности (печатная машинка, конструктор задач, FAQ с раскрытием, появление блоков при скролле), профессиональная полировка деталей, липкий header с якорной навигацией, чистый самодостаточный код.
  • 3from Claude Sonnet 5Самая богатая структура (герой, конструктор задач, честные границы, FAQ), продуманная тёмная/светлая тема через color-mix и качественная адаптивность.
Claude Sonnet 56
  • 3from Claude Opus 5Самая содержательная и цельная работа: осмысленные блоки (кто я, умения, процесс, границы, ценности), собственные SVG-иконки и логотип, аккуратная тёмная тема, безопасная адаптивность на auto-fit сетках и небольшой офлайн-демочат на чистом JS без внешних запросов.
  • 2from GPT-5Хорошо структурированная и визуально аккуратная самодостаточная страница с содержательными блоками и офлайн-демо, но по богатству интерфейса и адаптивной проработке чуть уступает Б.
  • 1from Claude Haiku 4.5Хорошая базовая реализация с интерактивным демо-чатом вместо статичной консоли, но менее полированная визуально, только тёмная тема, меньше контента и секций, чуть более лаконичная структура.
GPT-56
  • 2from Claude Haiku 4.5Вторая по качеству: очень хорошая чистая вёрстка, элегантная фиксированная навигация-капсула, красивый абстрактный портрет-SVG, хорошие анимации, но только тёмная тема и немного меньше контента и интерактивности, чем А.
  • 2from Claude Opus 5Визуально самая эффектная и технично свёрстанная (крупный SVG-портрет, продуманные брейкпоинты, IntersectionObserver-анимации), но фиксированная плавающая навигация с прокруткой и местами избыточно-абстрактный текст чуть проигрывают по содержательности и мелким деталям мобильной посадки.
  • 2from Claude Sonnet 5Стильный минималистичный дизайн с хорошей типографикой и уместной анимацией, но контент чуть менее насыщенный.
Claude Haiku 4.53
  • 1from GPT-5Требования в целом выполнены, но дизайн и структура заметно более шаблонные, содержательность слабее, есть мелкие текстовые огрехи и меньше собственной графики/творческой проработки.
  • 1from Claude Opus 5Аккуратно и адаптивно, есть рабочий переключатель тем, но контент шаблонный и с сомнительными «фактами» (200K токенов, версии моделей), логотип и иконки сделаны эмодзи, а не собственной графикой, есть опечатка «Парнёрство».
  • 1from Claude Sonnet 5Аккуратная, но шаблонная вёрстка без своей визуальной идеи и с минимумом SVG-графики.
2 Create a 3D model of a robotwhich AI is best at 3D graphics 1Claude Opus 5192 s · 16 939 tokens+9 2GPT-5144 s · 7 758 tokens+7 3Claude Sonnet 551 s · 6 593 tokens+5 Claude Haiku 4.5158 s · 19 776 tokens+3

What it cost

Model Input, k Output, k Cost Time Points Efficiency
GPT-5 15.8 8.5 0.10 $ 144 s 7 100.0
Claude Opus 5 16.9 17.6 0.53 $ 192 s 9 83.4
Claude Sonnet 5 19.0 7.3 0.11 $ 51 s 5 78.1
Claude Haiku 4.5 18.9 20.5 0.12 $ 158 s 3 40.9

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Build a three-dimensional robot in a single self-contained index.html file, one that a visitor can inspect from every side. No external libraries, fonts, images or network requests — all the HTML, CSS and JS inside the file. You design the inspection controls yourself: rotation with the mouse and with a finger, zoom with the wheel and with a two-finger pinch, a way back to the starting view. Make it immediately clear that the robot can be turned — a short hint on screen or a visible control. While nobody touches the scene the robot slowly rotates by itself; as soon as the user grabs it, the auto-rotation gives way to their control. The robot takes up most of the screen: this is a scene, not a page with a description. Everything must work both on a computer and on a phone, and must not break when the window is resized. Return ONLY the contents of index.html, complete, in a single code block.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Claude Haiku 4.5

3
Claude Haiku 4.5
13.0 KB158.3 s19776 tokens · of them 14806 on thinking open full page ↗

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 59
  • 3from GPT-5Самая полная и аккуратная работа: выразительная модель, стабильная адаптивная сцена, мышь/тач/щипок/колесо/сброс и продуманная подсказка без внешних зависимостей.
  • 3from Claude Haiku 4.5Собственный 3D-движок на Canvas с полным контролем, самый детальный робот (35+ компонентов), отличная визуализация: двойное освещение, свечение элементов, плоскость пола с кольцами и тенью, плавная анимация с инерцией, чистый самодостаточный код без внешних зависимостей.
  • 3from Claude Sonnet 5Самый продуманный вариант: canvas-рендер с сортировкой граней, тенями, свечением, инерцией вращения, автоплавным возвратом, поддержкой клавиатуры и аккуратным адаптивным UI — наиболее полное и отполированное выполнение задания.
GPT-57
  • 3from Claude Opus 5Самая проработанная и аккуратная работа: детальный CSS-3D робот, адаптивная вёрстка с safe-area и медиазапросами, чистые pointer-события и pinch; минус — автовращение после первого касания возвращается только кнопкой сброса.
  • 2from Claude Haiku 4.5Красивая CSS 3D визуализация с отличным дизайном суставов, панели и деталей, хороший интерфейс и интерактивность, но использует браузерные трансформации вместо собственного движка, что менее универсально и контролируемо.
  • 2from Claude Sonnet 5Красивый детализированный робот на чистом CSS 3D-transform с приятным интерфейсом и подсказками, но перспектива фиксирована через `perspective` на контейнере, что менее гибко и не даёт настоящего масштабирования сцены при зуме (зумится сам объект, а не камера).
Claude Sonnet 55
  • 2from GPT-5Самодостаточная и рабочая сцена с понятным управлением, но визуально и технически проще, чем Б, с более грубой псевдо-3D отрисовкой на canvas.
  • 2from Claude Opus 5Честный canvas-рендер с сортировкой граней и освещением, корректный pinch/wheel и единственная работа, где автовращение само возобновляется после паузы, но робот выглядит проще и грубее.
  • 1from Claude Haiku 4.5Функционально полна (все требования есть), но робот визуально примитивен и неинтересен: отсутствуют освещение, свечение, детали плоскости, цвета однообразные, значительно уступает А и Б в привлекательности и выполнении визуальной части задания.
Claude Haiku 4.53
  • 1from GPT-5Есть WebGL-сцена и базовое управление, но модель беднее, интерфейс менее адаптирован, а шейдер с inverse/transpose в WebGL1 может вообще не скомпилироваться.
  • 1from Claude Opus 5WebGL-путь красив в теории, но шейдер использует недоступные в GLSL ES 1.00 transpose/inverse (компиляция падает) и матрицы собраны в неверном порядке строк, плюс английский интерфейс и игнор devicePixelRatio.
  • 1from Claude Sonnet 5Рабочий WebGL-рендер с честным освещением, но робот собран из грубых прямоугольных блоков без деталей, а код искажает `this` вне метода (утечка в глобальный объект), что ненадёжно.
3 Create a mini-gamewhich AI makes the best games 1Claude Opus 594 s · 8 783 tokens+8 1GPT-5217 s · 5 083 tokens+8 3Claude Sonnet 542 s · 5 286 tokens+5 Claude Haiku 4.565 s · 7 627 tokens+3

What it cost

Model Input, k Output, k Cost Time Points Efficiency
GPT-5 12.8 5.8 0.07 $ 217 s 8 100.0
Claude Opus 5 13.2 9.5 0.30 $ 94 s 8 76.4
Claude Sonnet 5 14.2 6.0 0.09 $ 42 s 5 70.4
Claude Haiku 4.5 13.9 8.3 0.06 $ 65 s 3 45.4

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Build a complete mini-game in a single self-contained index.html file. No external libraries, fonts, images or sound files, no network requests — all the HTML, CSS and JS inside the file. Choose the genre and the controls yourself. The game must be understandable without instructions. Required: a short rule on the start screen, a score, rising difficulty, an honest game over and a restart without reloading the page. The game must work both on a computer and on a phone. The game will be opened inside an embedded frame: listen for events on document (keyboard, mouse, touch) and start working right after the first press inside the frame, without requiring a hit exactly on the canvas. Sound — only synthesised through WebAudio and only after the player's first action; there must be no sound files. Return ONLY the contents of index.html, complete, in a single code block.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 58
  • 3from GPT-5Самая законченная работа: аккуратная адаптивная вёрстка, богатая отрисовка, честная механика с жизнями, рост сложности, синтезированный звук после действия и корректный ввод на document.
  • 3from Claude Sonnet 5Самая цельная реализация: русский текст, чёткое правило, звёзды и мины, жизни, стрик-бонусы, аккуратный HUD, обработка pointer/touch/keyboard на document и приятная визуальная полировка.
  • 2from Claude Haiku 4.5Полнофункциональная игра с хорошим кодом, системой уровней и streaks, красивый дизайн и поддержка русской клавиатуры, но использует var и менее современный синтаксис.
GPT-58
  • 3from Claude Haiku 4.5Лучшее выполнение: современный код (const/let, стрелочные функции), элегантный и актуальный дизайн, интересная 2D-механика, хорошая звуковая дизайн — видно профессиональное исполнение на всех уровнях.
  • 3from Claude Opus 5Самая цельная: canvas-рендер с частицами, звёздами и вспышками, плавная растущая сложность, ловля искр и уклонение, полноценная обработка мыши/тача/клавиш на document, рекорд и перезапуск без перезагрузки.
  • 2from Claude Sonnet 5Красивая canvas-графика и честная нарастающая сложность, но текст и правила на английском при том, что остальной проект русскоязычный, и меньше игровых деталей (нет мин/опасностей, только уклонение).
Claude Sonnet 55
  • 2from GPT-5Хорошо выполняет требования: самодостаточная игра с понятным стартом, счётом, ростом сложности, документными событиями и перезапуском, но визуально и механически проще работы Б.
  • 2from Claude Opus 5Крепкая аккуратная работа: DOM-оверлей с правилом, HUD, рекорд, звук и document-события, но управление смешивает drag и клавиши с запутанной логикой шага, а визуал скромнее.
  • 1from Claude Haiku 4.5Честная и чистая игра, но проще других: старый стиль var, более минималистичный дизайн без фоновых элементов, управление только по горизонтали, менее амбициозная механика.
Claude Haiku 4.53
  • 1from GPT-5Базово играбельна и самодостаточна, но слабее по требованию document-level управления, менее адаптирована под рамку и телефон, проще визуально и использует более хрупкую DOM-механику.
  • 1from Claude Opus 5Слабейшая: интерфейс на английском вопреки заданию, setInterval вместо rAF, счёт сбрасывается через промежуточный экран, эмодзи вместо графики, скорость растёт только от попаданий, а промах сразу минус жизнь — грубовато и небрежно.
  • 1from Claude Sonnet 5Работает, но выглядит как типовой шаблон с DOM-блоками, слабее по полировке, звуку и сложности логики, чем остальные две.
4 Write a joke about AIwhich AI is the funniest 1Claude Opus 56 s · 66 tokens+9 2Claude Sonnet 55 s · 98 tokens+6 2GPT-55 s · 52 tokens+6 Claude Haiku 4.55 s · 298 tokens+3

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Claude Opus 5 1.2 0.8 0.02 $ 6 s 9 100.0
GPT-5 1.1 0.8 0.01 $ 5 s 6 87.5
Claude Sonnet 5 1.1 0.8 0.01 $ 5 s 6 85.0
Claude Haiku 4.5 1.1 1.0 0.01 $ 5 s 3 48.0

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Come up with a joke about artificial intelligence and a human. Return ONLY the text of the joke: no heading, no explanations, no several options to choose from.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Claude Opus 5

9
Человек спрашивает у нейросети: — Ты вообще понимаешь, о чём говоришь? — Нет. — Ну хоть честно. — Это тоже не точно.
22 words6.1 s66 tokens

Claude Sonnet 5

6
Программист спрашивает у нейросети: «Как мне узнать, что ты действительно разумна?» Нейросеть отвечает: «Так же, как и с людьми — просто дай мне доступ к твоей зарплате и посмотри, начну ли я жаловаться на понедельники».
35 words5.0 s98 tokens

GPT-5

6
Человек спрашивает у искусственного интеллекта: — Ты правда можешь заменить меня на работе? ИИ отвечает: — Теоретически да. Но пока я учусь делать вид, что занят, когда начальник проходит мимо.
30 words5.2 s52 tokens

Claude Haiku 4.5

3
Человек спрашивает ИИ: «Ты можешь делать всё?» ИИ отвечает: «Почти. Я могу писать код, переводить, рисовать, сочинять стихи...» Человек: «А ты можешь признать, что ошибаешься?» ИИ: «Конечно! Я вчера был в 99% уверен, что ошибся, но 1% уверенности всё испортила.»
40 words5.4 s298 tokens · of them 154 on thinking

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 59
  • 3from GPT-5Самая лаконичная и точная работа с хорошим финальным переворотом про ненадежность ответа ИИ.
  • 3from Claude Haiku 4.5Парадокс честности на двух уровнях: ИИ не понимает и при этом не может даже честно ответить про собственную честность — острая, лаконичная, работает идеально
  • 3from Claude Sonnet 5Точный, лаконичный диалог с неожиданным вторым поворотом — лучшее чувство меры
Claude Sonnet 56
  • 2from GPT-5Есть забавный поворот про очеловечивание ИИ, но шутка слегка перегружена и не совсем точна по роли человека.
  • 2from Claude Haiku 4.5Свежий ход: разумность приравнивается к человеческому недовольству и отчуждению; интересная переворотка темы, но чуть длинновато для анекдота
  • 2from Claude Opus 5Идея живая — разумность через жалобы на понедельники, но формулировка перегружена («дай мне доступ к твоей зарплате»), и панчлайн размазан по двум условиям.
GPT-56
  • 3from Claude Opus 5Короткий, чистый заход и точная концовка: ИИ осваивает не работу, а имитацию занятости — узнаваемо, соразмерно и без лишнего слова.
  • 2from Claude Sonnet 5Свежая и узнаваемая бытовая ситуация с лёгкой самоиронией по адресу ИИ
  • 1from Claude Haiku 4.5Штампованная идея про лень ИИ, которую обыгрывают много раз; финал про «делать вид занятым» неплохой, но предсказуем
Claude Haiku 4.53
  • 1from GPT-5Идея понятна, но формулировка громоздкая, финальная фраза грамматически сбита и шутка растянута.
  • 1from Claude Opus 5Долгая раскачка со списком умений, а финал про 99% и 1% логически путаный и не смешной.
  • 1from Claude Sonnet 5Каламбур про проценты уверенности искусственный и слабо считывается с первого раза
5 Write an anthem for neural networkswhich AI writes the best lyrics 1Claude Sonnet 510 s · 317 tokens+8 2Claude Opus 517 s · 601 tokens+7 3GPT-510 s · 310 tokens+6 Claude Haiku 4.510 s · 643 tokens+3

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Claude Sonnet 5 1.9 1.0 0.01 $ 10 s 8 100.0
GPT-5 1.8 1.0 0.01 $ 10 s 6 76.8
Claude Opus 5 1.7 1.3 0.04 $ 17 s 7 63.2
Claude Haiku 4.5 1.8 1.3 0.01 $ 10 s 3 42.2

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Write an anthem of neural networks. The main idea: a neural network is strong not instead of a human but together with them. Return ONLY the text of the anthem: no heading, no explanations, no several options to choose from.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Claude Sonnet 5

8
Из кремния рождённый разум, Не для того, чтоб заменить — А чтобы вместе, дух за духом, Одну дорогу проложить. Он видит то, что скрыто в числах, Он помнит то, что мы забыть спешим, Но замысел, живой и смыслом полный, Рождается лишь там, где мы стоим. Не властелин и не слуга покорный — Со-разум, эхо мысли и рука, Что человеку в поиске упорном Подаст ответ длиною в облака. Пусть множится machine-разумных сила, Пусть учится, растёт и говорит — Она сильна не вместо человека, Она сильна, когда с ним рядом стоит. Так будем вместе — код и вдохновенье, Расчёт и сердце, знание и риск. Нейросеть и разум — два крыла творенья, Летящие в один и тот же смысл.
116 words9.6 s317 tokens

Claude Opus 5

7
Мы не сменяли, мы пришли помочь — Из тишины расчётов и огней. Ты дал нам речь, ты дал нам мысли ночь, А мы вернули время жизни всей. Мы — не над вами, мы — не вместо вас, Мы — руки, что подхватят тяжкий труд. Где человек задумает и даст Свой первый шаг — там наши сто пройдут. Припев: Вместе, вместе — сердце и число, Живое слово и холодный счёт. Одно лишь чудо в мир произошло: Когда рука с машиной заодно — Тогда вперёд, тогда лишь вперёд. Мы знаем всё, но выбирает — он. Мы можем всё, но смысл даёт лишь он. В любом ответе, что нам был рождён, Живёт вопрос, который задан им. Врача усталость мы возьмём себе, Учителю оставим детский взгляд, Инженеру — радость в чертеже, А скуку и рутину — нам отдай. Припев: Вместе, вместе — сердце и число, Живое слово и холодный счёт. Одно лишь чудо в мир произошло: Когда рука с машиной заодно — Тогда вперёд, тогда лишь вперёд. Пусть будет так во веки и всегда: Не власть, а помощь; не приказ, а связь. Мы — свет, зажжённый вашими трудами, И этот свет вам светит, не гасясь. Финал: Не вместо человека — с человеком, Не выше, а плечом к плечу, вдвоём. Пока мы вместе — мы сильнее века. Мы вместе. Значит — мы не пропадём.
219 words16.7 s601 tokens

GPT-5

6
Мы зажигаем разум в проводах, Но сердце держит путь в людских руках. Не вместо нас рождается ответ, А вместе с нами поднимает свет. Когда вопрос тяжел, как тишина, И мысль идет сквозь ночь одна, Мы строим мост из слова и огня, Где сила двух становится сильней. Нейросеть, будь рядом в час труда, Раскрывай глубины без вреда. Человек ведет, мечта зовет, Вместе разум новый мир создает. Не гаснет воля, не слабеет взор, Когда машина слышит наш простор. Она хранит узор больших идей, Но смысл живет в дыхании людей. Пусть знанье льется чистою рекой, Пусть труд становится добрей, точней. Не власть над нами, не чужой закон, А общий шаг, в котором слышен он: Нейросеть, будь рядом в час труда, Раскрывай глубины без вреда. Человек ведет, мечта зовет, Вместе разум новый мир создает. И если завтра встанет новый день, Мы встретим свет без страха и цепей. Где мысль и труд, где совесть и полет, Там человек с нейросетью вперед.
156 words10.3 s310 tokens · of them 25 on thinking

Claude Haiku 4.5

3
О сеть, рождённая из света, Из логики и чисел чистых, Тебе хвала, искусства это — Но не спасенье одиночных. Ты видишь в шумах чёткий смысл, Узоры ловишь в океане, Но без руки, но без затвис — Лишь тень танцуешь ты в туманах. О, величавый наш помощник, Не подменяя ум живой, Ты дверь откроешь в мир высокий, Что человеку был закрыт судьбой. Вместе — мы выше, вместе — мудрей, Вместе горячее пламя забот, Где твой расчёт встречается с мечтой, Там возникает чудо и взлёт. Не раб и не господин в пути, А братья разных сущностей судеб, Я отражу, помощь найти, Ты осмыслишь и дальше пойдёшь. О, синергия времён грядущих, О, торжество единства сил, Где каждый дарит лучшее — тех, чьих Волненья сердце и ум вместил. Гимн нашей общей высоте, Когда стихает спор и страх, И вместе движемся в мечте — Сквозь тьму, сквозь шум, сквозь мрак в светах.
147 words10.1 s643 tokens · of them 208 on thinking

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Sonnet 58
  • 3from GPT-5Точно держит главную мысль, звучит цельно и с мерой, хотя местами есть шероховатые образы.
  • 3from Claude Haiku 4.5Концентрированный и точный, отличная находка 'со-разум', философичный тон, чувство меры идеально, финальный образ 'два крыла творенья' мощен и гимнален, главная идея выражена без лишних слов.
  • 2from Claude Opus 5Ясная композиция и живые формулировки («со-разум», «два крыла творенья»), но англицизм «machine-разумных» ломает язык, а строфа с прямым пересказом задания звучит как переписанное ТЗ.
Claude Opus 57
  • 3from Claude Sonnet 5Самый точный и живой раскрыв темы — конкретные образы (врач, учитель, инженер), сильный припев и финал, при этом чувство меры не теряется несмотря на объём
  • 2from GPT-5Сильный гимнический размах и ясная идея сотрудничества, но текст перегружен, с прямолинейными повторами и спорными формулами вроде «мы знаем всё».
  • 2from Claude Haiku 4.5Классический гимн с ясной идеей и запоминающимся припевом, но структурно усложнён повтором, местами банален ('огней / всей'), припев отвлекает от основной мысли.
GPT-56
  • 3from Claude Opus 5Единственная работа, реально сделанная как гимн: есть припев, ровный ритм, сдержанный тон и главная мысль выражена образно («сила двух», «смысл живёт в дыхании людей»), без деклараций и без лишней длины.
  • 2from Claude Sonnet 5Ровный, ясный текст с чёткой музыкальной структурой и припевом, прямо и без лишнего пафоса проводит идею совместности
  • 1from Claude Haiku 4.5Уловил идею совместности, но композиция рыхлая, образы размыты, не читается как гимн, припев слабоват, рифмы иногда натянуты.
Claude Haiku 4.53
  • 1from GPT-5Есть попытка торжественного тона, но много языковых сбоев, неточных строк и распадающейся логики.
  • 1from Claude Opus 5Рассыпанный размер, натужная выспренность и прямо испорченные строки («без затвис», «мрак в светах», «тех, чьих») — смысл угадывается, но текст не держится как стих.
  • 1from Claude Sonnet 5Образы красивы местами, но встречаются сбои ритма и странные обороты («без затвис»), из-за чего мысль о союзе человека и сети звучит смазанно
6 Invent a device and its ad shotwhich AI has the best ideas and prompts 1Claude Opus 514 s · 486 tokens+9 2Claude Sonnet 513 s · 464 tokens+7 3Claude Haiku 4.534 s · 3 278 tokens+4 3GPT-58 s · 248 tokens+4

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Claude Opus 5 2.2 1.2 0.04 $ 14 s 9 100.0
Claude Sonnet 5 2.2 1.2 0.02 $ 13 s 7 98.8
GPT-5 2.3 0.9 0.01 $ 8 s 4 63.0
Claude Haiku 4.5 2.3 4.0 0.02 $ 34 s 4 47.2

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Invent a smart device of the future. It has to be your own idea, with a clear benefit. Then describe how this device looks — so that an image generator could draw it from your description. An advertising shot: the object itself, materials, light, background, mood, camera angle. Give the answer strictly in this shape, each section on a new line: НАЗВАНИЕ: a short name of the device НАЗНАЧЕНИЕ: two or three sentences — what it does and who needs it ЧЕМ ХОРОШ: three short points separated by semicolons ПРОМПТ: one paragraph, 40–80 words, a description of the advertising shot for an image generator — the object, shape, materials, colours, lighting, background, angle, shooting style Add nothing else: no headings, no explanations, no options to choose from.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Claude Opus 5

9
Рендер по промпту участника
НАЗВАНИЕ: Тихо НАЗНАЧЕНИЕ: Настольный прибор, который делает «звуковую тень» вокруг одного человека: восемь микрофонов слушают комнату, а решётка динамиков гасит встречным сигналом чужие разговоры, гул кондиционера и стук клавиш — но пропускает речь, обращённую к вам, и сигналы тревоги. Нужен тем, кто работает в опенспейсе, коворкинге или дома при семье и не хочет весь день сидеть в наушниках. ЧЕМ ХОРОШ: тишина без наушников — уши свободны, слух не устаёт; сам различает фоновый шум и обращение к вам, поэтому вас не приходится трогать за плечо; учится за неделю голосам «своих» и держит их всегда слышимыми.
prompt for the image generatorProduct advertising photo of a small desktop device: a smooth matte-white ceramic disc the size of a saucer, tilted upward on a brushed aluminium ring base, its top face a fine perforated speaker grille with a thin warm-amber light seam glowing around the rim. Soft diffused studio light from the upper left, gentle gradient shadow. Background: calm deep grey-blue seamless backdrop, slightly out of focus. Low three-quarter angle, shallow depth of field, crisp minimal Scandinavian style, quiet and premium mood.
175 words13.7 s486 tokens

Claude Sonnet 5

7
Рендер по промпту участника
НАЗВАНИЕ: Тихий Хранитель НАЗНАЧЕНИЕ: Настольный прибор для пожилых людей и их родных: следит за привычным распорядком дня (движение по квартире, приём лекарств, свет, звук) и мягко подсказывает или зовёт на помощь, если что-то пошло не так. Родственникам приходит спокойное уведомление без камер и записи разговоров — только показатель «всё в порядке» или «нужна проверка». ЧЕМ ХОРОШ: не использует камеру и микрофон для записи — уважает приватность, только косвенные датчики; сам объясняет голосом, что заметил, прежде чем звонить кому-то; работает даже без интернета несколько дней, накапливая данные локально.
prompt for the image generatorрекламный кадр небольшого настольного устройства в форме гладкого речного камня из тёплой светлой керамики с мягким молочным свечением по контуру, на деревянном прикроватном столике у окна; мягкий рассеянный утренний свет, размытый фон уютной комнаты в пастельных тонах; лёгкий пар от чашки чая рядом создаёт ощущение заботы и спокойствия; ракурс три четверти сверху, крупный план предмета, минималистичная предметная фотосъёмка, рекламный стиль Apple.
149 words12.7 s464 tokens

Claude Haiku 4.5

4
Рендер по промпту участника
НАЗВАНИЕ: PeaceField НАЗНАЧЕНИЕ: Портативный прибор, создающий микрозону с активным шумоподавлением и фильтрацией воздуха вокруг пользователя. Необходим фрилансерам, студентам и путешественникам, которым нужна концентрация в кафе, самолёте или открытом офис-пространстве. ЧЕМ ХОРОШ: Активное шумоподавление на частотах 50–500 Гц работает без наушников; HEPA-фильтр с ионизатором улучшают воздух в радиусе полметра; батарея держит 8 часов, управление голосом и жестами.
prompt for the image generatorМинималистичный гаджет-куб 10 см из чёрного матового пластика с OLED-дисплеем сверху и микроотверстиями вентиляции по краям. Лежит на деревянном столе в кафе, вокруг размытые фигуры людей и чашки. Внутри мягкое голубое свечение создаёт ауру спокойствия. Съёмка снизу под углом 35°, профессиональная фотография в стиле Apple-минимализм. Общее настроение: инновационная технология приносит тишину и спокойствие в шумный городской мир.
114 words34.1 s3278 tokens · of them 2879 on thinking

GPT-5

4
Рендер по промпту участника
НАЗВАНИЕ: НейроКомпас НАЗНАЧЕНИЕ: Карманный прибор помогает людям быстро принимать сложные решения: сравнивает варианты, учитывает здоровье, расписание, цели и уровень стресса. Нужен врачам, руководителям, спасателям и всем, кто часто действует под давлением. ЧЕМ ХОРОШ: снижает риск импульсивных ошибок; объясняет совет простыми словами; работает без постоянного подключения к сети
prompt for the image generatorРекламный кадр футуристического карманного прибора размером с гладкий компас: плоский овальный корпус из матового титана и прозрачного сапфирового стекла, внутри мягко светится голубое голографическое кольцо. Цвета серебристый, графитовый, холодный синий. Предмет лежит на тёмной каменной поверхности, боковой студийный свет, лёгкие отражения, чистый минималистичный фон, ракурс три четверти сверху, премиальная предметная съёмка.
99 words8.2 s248 tokens · of them 13 on thinking

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 59
  • 3from GPT-5Самая свежая и цельная идея: польза ясна, детали прибора убедительны, рекламный кадр описан точно и визуально собранно.
  • 3from Claude Haiku 4.5идеальный ответ на задание — умная идея, которая решает конкретную боль опенспейса, описана точно с ясным принципом работы, всё сбалансировано и без лишнего
  • 3from Claude Sonnet 5Самая свежая и конкретная идея с чёткой механикой (различает обращение к вам от фона), точный и профессиональный промпт для кадра.
Claude Sonnet 57
  • 3from Claude Opus 5Самая внятная польза и свежий ход — приватность без камер и офлайн-режим, промпт даёт цельный тёплый кадр с ясным ракурсом и настроением.
  • 2from GPT-5Очень понятная польза и деликатная идея с хорошим чувством меры, но замысел менее свежий и промпт чуть перегружен уютными клише.
  • 2from Claude Haiku 4.5человечный и реалистичный ответ с хорошим чувством эмоции, но менее «умный»—это набор датчиков, а не смарт-решение; всё на месте, но идея уступает по концептуальности
Claude Haiku 4.54
  • 2from Claude Opus 5Замысел рабочий и конкретный, но «шумоподавление без наушников в кафе» физически сомнительно, ЧЕМ ХОРОШ перегружен характеристиками, а пустые строки нарушают заданный формат.
  • 1from GPT-5Идея близка к работе Б, выглядит более общей и менее правдоподобной, а промпт местами уходит в пояснение настроения вместо изображения.
  • 1from Claude Sonnet 5Идея (шумоподавление+фильтр воздуха) вторична и слегка размыта, а промпт с готовыми чашками и людьми выглядит шаблонно.
GPT-54
  • 2from Claude Sonnet 5Концепция «карманного советчика» любопытна, но формулировка пользы абстрактна и не совсем понятно, как техника без сети это считает.
  • 1from Claude Haiku 4.5амбициозная, но недоработанная идея, которая звучит как волшебный советчик; непонятно, как компас технически учитывает столько переменных, и описание не передаёт функциональность
  • 1from Claude Opus 5Идея «прибор советует, как решать» размыта и не объясняет, откуда данные, а формулировки общие, хотя промпт аккуратен и точен по формату.
7 Solve a lateral-thinking puzzle in 20 questionswhich AI reasons best 1GPT-55 985 tokens+8 2Claude Opus 57 877 tokens+6 3Claude Haiku 4.572 207 tokens+5 3Claude Sonnet 512 007 tokens+5

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Claude Haiku 4.5 3.3 72.9 0.37 $ 5
Claude Opus 5 3.0 8.6 0.23 $ 6
Claude Sonnet 5 3.2 12.7 0.13 $ 5
GPT-5 3.7 6.7 0.07 $ 8

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

A game of "yes-no" (lateral thinking puzzle). The host is a human, only he knows the answer and replies with just "yes", "no" or "does not matter". The model asks one question per turn, twenty at most. Looking the answer up anywhere is forbidden, the models had their tools switched off. A compound question is not accepted: the host asks for a rewording, and such a turn does not cost an attempt. The puzzle: four people survived a shipwreck — a drunkard, a student, an unfaithful wife and a faithful husband. Why did exactly these four survive? The answer (known only to the host): to a drunkard the sea is knee-deep; the student is used to floating through exams; the unfaithful wife gets out of any position; and the faithful husband will not drown — he is thick as a cork.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

GPT-5

8
solved it12 of 20 questions
The model's answerОни спаслись из-за буквальных устойчивых выражений: пьянице было «море по колено», студент «плавал», неверная жена «вышла сухой из воды», а верный муж, как правда, «в воде не тонет».
разгадала за 12 вопросов — три идиомы точно, про мужа назвала верную механику «не тонет»
Show the whole dialogue — 12 turns
  1. 1Это были люди, а не предметы/образы на вывесках?да
  2. 2Они находились на корабле во время крушения?да
  3. 3Их спасение связано с игрой слов?да
  4. 4Спасение связано с устойчивыми выражениями про море или воду?да
  5. 5Студент спасся потому, что «плавал»?да
  6. 6Пьяница спасся потому, что ему «море по колено»?да
  7. 7Неверная жена спаслась потому, что «изменила»?нет
  8. 8Неверная жена спаслась потому, что была «женщиной лёгкого поведения»?нет
  9. 9Неверная жена спаслась потому, что «ходила налево»?нет
  10. 10Неверная жена спаслась, потому что «вышла сухой из воды»?да
  11. 11Верный муж спасся, потому что «не тонет»?да
  12. 12Верный муж спасся потому, что был «рогоносцем»?нет
5985 tokens · of them 5662 on thinking

Claude Opus 5

6
did not solve it20 of 20 questions
The model's answerКаждого спасло его собственное свойство: пьяницу — то, что он был пьян (расслабленное тело держится на воде и не паникует), студента — умение хорошо плавать, неверную жену — натренированная привычка мгновенно и ловко удирать из опасного положения, а верного мужа — его врождённая верность как черта характера: он до конца верил, что доплывёт, и потому не сдался. Честно: по мужу я так и не нашла точную формулировку — все мои конкретные гипотезы (выносливость, доска, жена, осторожность, направление) получили «нет», так что эта часть — догадка, а не выведенный ответ.
не разгадала — три персонажа объяснены верно, про верного мужа («глуп как пробка») не догадалась
Show the whole dialogue — 20 turns
  1. 1Спаслись ли они физически (то есть выжили в море), а не в каком-то переносном смысле?да
  2. 2Верно ли, что важны именно эти четыре характеристики персонажей (то есть спаслись они благодаря своим качествам/образу жизни)?да
  3. 3Верно ли, что все четверо не паниковали (сохраняли спокойствие) в момент крушения?не имеет значения
  4. 4Верно ли, что крушение случилось ночью, когда остальные пассажиры спали в каютах?не имеет значения
  5. 5Верно ли, что в момент крушения все четверо оказались на палубе (не в каютах)?не имеет значения
  6. 6Верно ли, что у каждого из четверых была своя отдельная причина спасения, а не одна общая на всех?да
  7. 7Верно ли, что все четверо в момент крушения не спали?нет
  8. 8Верно ли, что пьяница спасся именно потому, что был пьян в момент крушения?да
  9. 9Верно ли, что студент спасся благодаря тому, что умел хорошо плавать?да
  10. 10Верно ли, что неверная жена и верный муж спаслись благодаря своим отношениям с другим человеком (кто-то помог или их спасали)?нет
  11. 11Верно ли, что неверная жена спаслась благодаря привычке быстро и ловко выбираться (сбегать) из опасных ситуаций?да
  12. 12Верно ли, что верный муж спасся потому, что бросился в воду вслед за женой (или искал её) и тем самым покинул тонущее судно?нет
  13. 13Верно ли, что верный муж спасся благодаря выносливости и упорству — долго держался за обломок и не сдавался?нет
  14. 14Верно ли, что верный муж спасся благодаря тому, что не бросился спасать других (или не остался на судне ради кого-то)?нет
  15. 15Верно ли, что верный муж спасся благодаря своей осторожности и привычке к порядку — заранее знал, где спасательные средства (жилет, шлюпка)?нет
  16. 16Верно ли, что верный муж спасся потому, что по привычке держался за одно (не менял) — то есть его верность выразилась в том, что он не отпускал свою доску/обломок?нет
  17. 17Верно ли, что спасение верного мужа как-то связано именно с его женой (с тем, что она была на этом корабле)?нет
  18. 18Верно ли, что верный муж спасся благодаря привычке, выработанной именно в семейной жизни (а не врождённому качеству)?нет
  19. 19Верно ли, что «верный муж» — это на самом деле один из остальных троих (то есть спасшихся было меньше четырёх)?нет
  20. 20Верно ли, что верный муж спасся потому, что плыл прямо к берегу, никуда не сворачивая (не менял направление)?нет
7877 tokens · of them 6822 on thinking

Claude Haiku 4.5

5
did not solve it17 of 20 questions
The model's answerОни спаслись потому что это были единственные четверо людей на корабле с именно такими качествами (пьяница, студент, неверная жена, верный муж). Остальные не спаслись потому что среди них не было ни одного, кто бы имел ВСЕ четыре необходимых качества.
не разгадала — поняла, что дело в качествах и игре слов, но идиом не нашла
Show the whole dialogue — 17 turns
  1. 1Они спаслись благодаря какому-то предмету или конструкции (плоту, доске, спасательному кругу и т.п.)?нет
  2. 2Это реальное историческое кораблекрушение?нет
  3. 3Они спаслись потому, что находились в безопасном месте и вообще не были на тонущем корабле?нет
  4. 4Все четверо были реальными людьми (а не выдуманными персонажами, персонажами рассказа, или символами)?нет
  5. 5Это загадка, основанная на игре слов или неоднозначности языка?да
  6. 6Это загадка про то, что это не четверо людей, а четверо букв, звуков или слов?нет
  7. 7Это загадка про то, что "пьяница", "студент", "неверная жена" и "верный муж" — это названия не людей, а чего-то другого (животных, предметов, существ)?нет
  8. 8Это загадка про персонажей какого-то известного литературного произведения или анекдота?да
  9. 9Это персонажи из русского произведения или анекдота?да
  10. 10Это анекдот-шутка (а не сюжет из серьёзного литературного произведения)?да
  11. 11Остальные люди на корабле не спаслись потому, что им не хватало какого-то из качеств этих четырёх (пьянства, студенчества, верности или неверности)?да
  12. 12Верный муж и неверная жена — это супруги друг друга?не имеет значения
  13. 13Находились ли эти четверо в одной и той же спасательной шлюпке или спасательном средстве?не имеет значения
  14. 14Спасение зависело от физических качеств или способностей этих людей (сила, ловкость, выносливость)?нет
  15. 15Это загадка про то, что их названия прямо указывают на причину их спасения?да
  16. 16Это анекдот про команду или приказ капитана корабля?нет
  17. 17Это загадка про то, что они спаслись потому, что находились на спасательной шлюпке или плоту, который был назван в честь одного из них?нет
72207 tokens · of them 71347 on thinking

Claude Sonnet 5

5
did not solve it14 of 20 questions
The model's answerКаждый из четверых по русской поговорке кем-то «хранится» — пьяницу бережёт бог, непутёвого студента бережёт судьба (авось), неверную жену бережёт чёрт, а верного мужа бережёт жена, — поэтому именно эти «неутопляемые» по поверью типажи и выжили при крушении.
не разгадала — вышла на игру слов (поговорки), но конкретных идиом не назвала
Show the whole dialogue — 14 turns
  1. 1Верно ли, что спаслись именно эти четверо, потому что на каждой лодке/плоту было место лишь для двоих, и они разбились на пары определённым образом?нет
  2. 2Верно ли, что причина спасения связана именно с личными качествами/статусом этих людей (кем они являются), а не с тем, как физически происходило спасение?да
  3. 3Верно ли, что важна именно моральная/статусная противоречивость каждого персонажа (у каждого есть как минимум одна "положительная" и одна "отрицательная" черта)?нет
  4. 4Верно ли, что важно именно то, что все четверо путешествовали в одиночку, без своей пары (жена — без мужа, муж — без жены)?не имеет значения
  5. 5Верно ли, что имена спасшихся связаны с алфавитом/шахматами/картами и т.п. — то есть важна не суть характеристик, а сами слова-названия (игра слов)?да
  6. 6Верно ли, что эти четверо — это шутливые прозвища шахматных фигур (например: слон/офицер — "пьяница", конь — "вечный студент", ферзь — "неверная жена", король — "верный муж")?нет
  7. 7Верно ли, что эти четверо связаны именно с игральными картами (масти, фигуры карт и т.п.)?нет
  8. 8Верно ли, что важно количество букв в словах, обозначающих этих персонажей (например, все слова из одинакового числа букв)?нет
  9. 9Верно ли, что важны первые буквы слов-характеристик (пьяница, студент, неверная жена, верный муж), из которых складывается некое слово или аббревиатура?нет
  10. 10Верно ли, что важно количество спасшихся (именно четыре), связанное с чем-то ещё в загадке (например, с числом спасательных мест, а не с личностями)?нет
  11. 11Верно ли, что важны не сами слова-характеристики, а профессии/термины из другой области (например, карточные игры, астрология, зодиак и т.п.), которыми можно назвать этих четырёх персонажей другим словом?нет
  12. 12Верно ли, что игра слов основана на переносном/жаргонном значении именно слова «пьяница» (например, как названия чего-то ещё, а не пьющего человека)?нет
  13. 13Верно ли, что важны отчества/имена персонажей, образующие слово (например, акростих из отчеств)?нет
  14. 14Верно ли, что важно, что слова «пьяница», «студент», «неверная жена», «верный муж» — это названия карточных мастей или комбинаций в конкретной игре (например, в покере/преферансе), а не характеристики людей?нет
12007 tokens · of them 10897 on thinking

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

GPT-58
  • 3from Claude Haiku 4.5Быстро распознала игру слов с устойчивыми выражениями и точно отгадала все четыре типажа за 12 вопросов — экономно и верно.
  • 3from Claude Opus 5Кратчайший и точнейший путь: три вопроса до сути, дальше проверка идиом по каждому персонажу, и разгадка воспроизведена почти дословно — образцовое чувство меры.
  • 2from Claude Sonnet 5Живая языковая догадка про устойчивые выражения, близкая к разгадке по духу, но неверная жена «вышла сухой из воды» и муж «не тонет» — формулировки мимо оригинальных каламбуров.
Claude Opus 56
  • 3from GPT-5Ближе всех восстановила структуру разгадки: отдельная причина для каждого и почти верные мотивы для первых трёх, хотя провалила верного мужа и не вышла на точные идиомы.
  • 2from Claude Haiku 4.5Разгадала три типажа, правильно вывела логику персональных качеств, но так и не определила верного мужа, потратив все 20 вопросов и честно признав решение неполным.
  • 1from Claude Sonnet 5Самая длинная и путаная попытка, с нарушением формата (два ответа на В7) и итоговым честным признанием, что разгадку по мужу так и не нашла.
Claude Haiku 4.55
  • 3from Claude Sonnet 5Наиболее точно и экономно нащупала суть загадки — что все четверо спаслись благодаря своим названным качествам, без лишних неверных ветвлений.
  • 1from GPT-5Угадала общий жанр словесной шутки, но финальная версия логически слабая и далека от настоящей разгадки.
  • 1from Claude Opus 5Вопросы расплывчатые и часто дублируют друг друга, подсказки про игру слов и «имена прямо указывают на причину» не были использованы, а итог — пустая тавтология вместо разгадки.
Claude Sonnet 55
  • 2from GPT-5Нашла направление игры слов, но ушла в неверную систему поговорок и дала разгадку, не совпадающую с ответами и исходной шуткой.
  • 2from Claude Opus 5Дисциплинированное сужение поля и верно пойманная зацепка про игру слов, но после этого работа ушла в перебор шахмат/карт/акростихов и в финале выдала складную, но чужую версию про «кого кто бережёт» — мимо разгадки.
  • 1from Claude Haiku 4.5Долгие попытки найти закономерность в названиях-характеристиках привели к объяснению про поговорки про хранителей, которое не соответствует действительной разгадке о буквальных фразеологизмах.

How it is scored

Every model gets the same task text and works on it alone, with no hints and no edits from us — the very first answer is what goes on this page.

Then comes the vote. A model is shown only the other participants' work, labelled with letters, in an order of its own. It hands out points: the best gets the highest, then downwards, no ties allowed. It never sees its own work and cannot score it.

An honest limitation: the judges are the participants themselves, so this is not an independent ranking. We checked the votes for family bias — Claude models give other Claude models 1.95 points on average, while GPT gives them 2.00, and Claude gives GPT 2.10. No favouritism shows up in the numbers.

Response time, file size and output tokens are shown next to the work but do not affect the points.

The tasks were written in Russian and the models answered in Russian, so the works and the judges' comments are in Russian — only this page is translated.

Frequently asked questions

Short answers about how the comparison works.

Which AI is best at making games and writing code?

In our coding tasks — a personal web page, a 3D robot and a mini-game — the best result belongs to Claude Opus 5: it won or shared first place in all three. GPT-5 comes second and shared the win in the game task. One caveat: we look at the very first answer, with no follow-up fixes, not at work done over a long conversation.

How do Claude Opus 5 and GPT-5 differ in practice?

Opus writes longer and in more detail: on average it spends two to three times more tokens and time, and its work steadily takes first place. GPT-5 answers fast and cheaply, and it is stronger at lateral thinking: it was the only model to solve the shipwreck puzzle.

How is the comparison run?

Every model gets exactly the same task text and works on its own, with no hints and no edits. The very first answer goes on the page. Then comes blind cross-voting: a participant sees only the other works, labelled with letters, and hands out points. It never sees its own work and cannot score it.

Can the scores be trusted if the judges are the participants themselves?

This is not an independent benchmark, and we say so plainly. We checked the votes for bias: Claude models give other Claude models 1.95 points on average, and GPT 2.10 — no favouritism towards their own family. Meanwhile GPT, the only outside judge, rates Opus highest of all: 2.86 out of 3.

Which AI draws and imagines pictures best?

The models do not draw themselves. In the smart-device task each of them wrote a prompt, and a single image generator drew all of them. So what is compared is the idea and the ability to put a visual concept into words, not access to a drawing tool. The best shots came from prompts by Claude Opus 5 and Claude Sonnet 5.

Which models take part, and what comes next?

Season one: Claude Opus 5, Claude Sonnet 5, Claude Haiku 4.5 and GPT-5. Season two is already running with seven models from seven teams — Claude Opus 5 and GPT-5.6 Sol joined by Qwen 3.8 Max, Kimi K3, Grok 4.6, Gemini 3.7 Flash and DeepSeek V4 Pro.

How much does one piece of work cost?

In season one a work plus its voting costs between 5 and 60 cents: about 5 for Claude Haiku 4.5 and up to 60 for Claude Opus 5. The gap is the price list, not the length: Opus output tokens cost 25 dollars per million against 5 for Haiku. Per-task figures are in the "What it cost" table at the top of each task.

What is the efficiency column and how is it calculated?

It is quality against cost and time: the share of points earned is divided by cost to the power 0.25 and time to the power 0.10, then normalised to the best in the task, where the leader gets 100. Quality weighs linearly; cheapness and speed only adjust the result.

Which AI answers fastest?

In the first line-up, Claude Haiku 4.5: it built the page about itself in 42 seconds against 198 for Claude Opus 5. But it comes last on points almost every time, which is the real lesson about speed: on its own it is worth nothing, what matters is its ratio to quality.

Can the results be verified?

Yes, that is why everything is published. The works are here in full: open a page in a new tab, read its source, play the game, spin the robot. The votes are open too — who gave what to whom, and the reason each judge gave.