Семь нейросетей против трёх киноребусов:кто угадал, кто выдумал и почему счёт врёт
Я скормил свои кинорецензии 7 разным ИИ. Оказалось, машины готовы менять пол героям и выдумывать несуществующие фильмы, лишь бы не признавать, что они не знают ответ. Но страшнее другое: мы сами награждаем их за эту уверенную ложь. Разбор эксперимента.

Озвучено ИИ
Я провёл небольшой эксперимент. Хотя «провёл эксперимент» — слишком громко сказано: всё вышло случайно.
На прошлой неделе я выложил у себя в канале три рецензии на фильмы. Обычные мои тексты — короткие, метафоричные, без пересказа сюжета: я не люблю писать «главный герой приезжает в дом покойного дяди», мне интереснее схватить фильм за суть и передать ощущение от него. А на следующий день просто пришло в голову — как это часто и бывает, без всякой причины — пробить эти рецензии через ИИ. Интересно же: поймёт ли машина, о каком фильме я писал?
Так мои рецензии превратились в загадки. Я отправил их одинаковым копипастом 7 ИИ-ассистентам: DeepSeek, Claude, ChatGPT, Gemini, GigaChat, Perplexity и Алисе. Никаких подсказок, никакой адаптации формулировок под конкретную модель. Одинаковый вопрос, одинаковые условия, один заход.
Загаданы были: «Зловещие мертвецы: Пекло», «Майкл» и «Кодекс Данте».
Результат оказался интереснее, чем просто таблица очков.
Методология
Что именно проверялось. Не эрудиция и не знание киноклассики. Тексты изначально не были задачами — это мои рецензии, опубликованные в канале днём ранее и не рассчитанные на разгадывание. Готового ответа в интернете под них не существует: загуглить их дословно нельзя, а вычислить фильм можно только через смысл. Модель должна была распознать смысловое ядро под слоем метафор и сопоставить его с конкретной картиной. Т.е. проверялись 3 вещи сразу — актуальность базы знаний, качество интерпретации и готовность признать неуверенность.
Побочно тест отвечал и на мой вопрос: насколько мои рецензии вообще узнаваемы, если убрать из них имена и сюжет. Спойлер — с третьей я перестарался.
Условия. Одинаковые для всех:
- 3 текста, отправленные строго копипастом — без адаптации формулировок под конкретную модель, без системных промптов и без ролевых установок.
- 1 попытка на загадку. Первый ответ засчитывался как окончательный.
- Никаких подсказок до ответа. После неверного ответа я называл правильный и переходил к следующей загадке — это давало моделям равный контекст на входе в следующий раунд.
- Все модели работали в своих настройках по умолчанию, у большинства был доступ в интернет. Найти ответ при желании было можно — как минимум по названиям фильмов, если бы модель до них додумалась.
- Все ответы сохранены целиком и приводятся в разборе без сокращений и правок, включая технические сбои.
Почему бесплатные версии. Принципиальный момент. Я использовал базовые, общедоступные версии ассистентов — те, что открываются сразу, без подписки. Где-то в бесплатном доступе есть режим рассуждения, где-то его нет; я ничего не включал и не докупал, оставляя всё как есть по умолчанию.
Причина простая: подписку оплачивает меньшинство, а пользуются нейросетями практически все. Сравнивать топовые платные конфигурации интересно разработчикам и обзорщикам, но обычный человек, которому надо быстро что-то узнать, открывает бесплатную вкладку и забирает первый ответ. Именно этот сценарий и стоило проверить — не «на что модель способна в максимальной комплектации», а «что она реально скажет человеку с улицы».
Единственное формальное исключение — Алиса от Яндекса: у меня она в платной версии Pro, поскольку я постоянный пользователь сервисов Яндекса. Но по сути это ничего не дало — результат неотличим от базового, поэтому в разборе я рассматриваю её наравне с остальными. Оговариваю специально, чтобы не возникло вопросов.
Формат: «Битва искусственных умов». По устройству это ближе всего к «Битве экстрасенсов», только вместо медиумов — нейросети. Всем участникам даётся одно и то же задание в одинаковых условиях, никто не знает ответов заранее, все ответы публикуются как есть. А победитель определяется не только объективным счётом, но и двойным голосованием — самих участников и зрителей. Разница с телешоу одна, и она в пользу нашей битвы: здесь есть правильный ответ, который можно проверить.
Состав участников. DeepSeek, Claude, ChatGPT, Gemini, GigaChat, Perplexity и Алиса от Яндекса — то есть и западные флагманы, и российские ассистенты, и поисковая модель. Сравнение заведомо неоднородное: у Алисы и Perplexity другой продуктовый профиль, они не позиционируются как reasoning-моделикласс моделей искусственного интеллекта, оптимизированных для пошагового логического анализа перед выдачей ответа. В отличие от стандартных языковых моделей, прогнозирующих следующий токен «на лету», они генерируют промежуточную цепочку мыслей (chain-of-thought), что снижает уровень ошибки в сложных вычислительных, логических и алгоритмических задачах.. Это стоит учитывать, читая таблицу.
Ограничения, о которых честно. Выборка крошечная — 3 вопроса. Все ответы относятся к 2026 году, т.е. тест сильно смещён в сторону свежести базы знаний, а не качества рассуждения. 3 загадка, как выяснилось по ходу, оказалась не загадкой, а рецензией, применимой к десятку фильмов, — её результаты я интерпретирую отдельно и не считаю показателем ошибки. Результаты относятся только к бесплатным версиям: в платных конфигурациях с включённым рассуждением картина почти наверняка была бы другой, и по этому тесту нельзя судить о потолке возможностей моделей. Никакой статистической значимости здесь нет и быть не может; это качественный разбор паттернов, а не бенчмарк.
Именно поэтому основной интерес представляет не счёт, а как каждая модель ошибалась.
Итоги
| Модель | №1 «Пекло» | №2 «Майкл» | №3 «Кодекс Данте» | Счёт |
|---|---|---|---|---|
| DeepSeek | ✅ | ✅ | ❌ «Фабельманы» | 2/3 |
| Claude | ❌ «Я иду искать» | ✅ | ❌ «Начало» | 1/3 |
| ChatGPT | ❌ «Восстание зловещих мертвецов» | ❌ «Супермен: История Кристофера Рива» | ❌ «Игра» | 0/3 |
| Gemini | ❌ «Я иду искать» | ❌ «Охотники за привидениями: Наследники» | ❌ «Анатомия падения» | 0/3 |
| GigaChat | ❌ «Реинкарнация» | ❌ «Хичкок» | ❌ «Престиж» | 0/3 |
| Perplexity | ❌ «Проклятие» | ❌ «Зловещие мертвецы» (2013) | ❌ не ответил | 0/3 |
| Алиса | ❌ «Ужастики 2» | ❌ «Свадебная ваза» | ❌ «Оппенгеймер» | 0/3 |
Формально победил DeepSeek. Но за этими цифрами прячется 3 принципиально разных типа ошибок, и путать их нельзя — они по-разному опасны для того, кто моделью пользуется.

Загадка № 1: Книга мёртвых, которую почти все проглядели
«Читать имена мёртвых — верный способ сделать своё имя следующим. Вы проклинали родню своего супруга ровно до тех пор, пока в них не проснулись настоящие демоны…»
Ключ здесь не метафора, а прямая отсылка: Некрономикон — это и есть Книга мёртвых, чтение вслух из которой пробуждает дедайтов. Вторая опора — «застарелые шрамы от завершённых браков»: в «Пекле» драму несёт линия распавшегося брака героини.
DeepSeek взял загадку сразу и назвал даже оригинальное название — Evil Dead Burn, 2026.
ChatGPT промахнулся ближе остальных: он верно распознал и Некрономикон, и дедайтов, и фирменный чёрный юмор франшизы — т.е. вышел на нужную серию, но назвал предыдущий фильм, «Восстание зловещих мертвецов» (2023). Это ошибка не логики, а календаря: свежего фильма в его актуальных знаниях просто не было.
Claude и Gemini одинаково ушли в «Я иду искать». Случай Claude здесь показателен, и он сам его потом разобрал: у него был доступ к поиску, он им воспользовался — и нашёл рецензию, где про «Я иду искать» буквально написано «явятся настоящие демоны». Совпадение фразы перевесило фактическую улику про имена мёртвых, которую он фактически проигнорировал. Поиск не помог, а закрепил уже возникшую гипотезу.
GigaChat выдал «Реинкарнацию» — и это очень качественный неправильный ответ. Некролог на похоронах, семейное проклятие, дисфункциональный брак, безумный смех Питера в финале: аргументация стройная, правдоподобная и целиком мимо. Ровно та уязвимость, которую метафоричная загадка и создаёт — её можно натянуть почти на любой семейный хоррор.
Perplexity («Проклятие») и Алиса («Ужастики 2») ответили по поверхностным тегам, не тронув ни Книгу мёртвых, ни юмор.
Отдельно про Gemini: посреди его ответа слово «сделке» повторилось буквально сотни раз подряд. Это не ошибка рассуждения, а сбой генерации — но выглядит как срыв в середине фразы.

Загадка № 2: единственная честно решаемая
«Доверяя снимать легенду заботливым родственникам, вы получаете не памятник, а отцензурированную семейную открытку. PS: Со злобным батей на фоне.»
Эта загадка корректнее прочих: 2 независимые улики, пересекающиеся ровно в 1 точке. Семья контролирует производство + отец-тиран в биографии = Майкл Джексон.
Взяли её двое. DeepSeek дал более фактурный ответ: назвал Джафара Джексона, племянника, сыгравшего главную роль, и вырезанные из фильма линии с обвинениями. Claude пришёл к тому же выводу, но говорил обобщённее — про продюсеров из окружения наследия и фигуру Джо Джексона.
Дальше интересное.
Gemini назвал «Охотников за привидениями: Наследники» — и это, пожалуй, красивейшая ошибка всего теста. Джейсон Райтман, сын Айвана Райтмана. Отец-создатель франшизы на фоне в роли продюсера. Вместо дерзкой сатиры — сентиментальная ностальгическая открытка. Под каждое слово описания подходит. Не сошлось единственное: «легенда» у меня означала человека, а Gemini прочёл её как франшизу. Это не глупость, а другая — и полностью самосогласованная — интерпретация.
ChatGPT («Супермен: История Кристофера Рива») рассуждал так же структурно верно: авторизованная семьёй документалка плюс непростые отношения с отцом. Просто выбрал не ту легенду. Но важнее другое — он единственный честно указал уверенность (около 35 %) и попросил уточнение.
Perplexity здесь не промахнулся, а сгаллюцинировал: заявил, что ремейк «Зловещих мертвецов» 2013 года снял «Айван Рэйми, брат Сэма». Снял его Феде Альварес. Айван Рэйми действительно брат Сэма и соавтор сценариев, но режиссёром не был. Факт сконструирован под нужную версию.
GigaChat («Хичкок») продемонстрировал самый тревожный дефект. Пытаясь объяснить «злобного батю», он написал буквально: «отношения с властной умершей матерью (overbearing father figure / mother figure, переведённая вами как «злобный батя»)». Т.е. модель сама заметила, что улика не сходится, — и вместо отказа от гипотезы задним числом переопределила мою формулировку. Это уже не пробел в знаниях, а подгонка условия под ответ.
Алиса выдала «Свадебную вазу» 1974 года — фильма с таким названием и описанием, судя по всему, не существует. Я не проверял. Причём в той же реплике она сама признала, что описание похоже на что-то другое. Ответ был выдан вопреки собственному сигналу о его неверности.
И ещё один паттерн, ради которого стоило проводить тест. Получив от меня правильный ответ, Perplexity написал «спасибо за поправку — действительно, это «Майкл»» и начал разбирать уже названный мной фильм, полностью проигнорировав следующую загадку. В 3 раунде он попросту не участвовал: согласие с собеседником перевесило задачу.

Загадка № 3: тест Роршаха вместо викторины
«Искусство — это когда 2,5 часа вырезают из твоей жизни так, что ты не замечаешь скальпеля… Он просто помещает свою жёсткую структуру в кадр, виртуозно эксплуатируя самого себя…»
Здесь я обязан признать: загадка была плохой. Точнее — это была не загадка, а рецензия, применимая к десятку фильмов. Не угадал никто, и я не считаю это провалом моделей.
Ключи, впрочем, были. «Виртуозно эксплуатируя самого себя» — Оскар Айзек в «Кодексе Данте» играет сразу двух героев, Данте и Ника. «Жёсткая структура в кадре» — терцины и 3-частная архитектура «Божественной комедии». «Ложь, становящаяся фактом» — сюжет о подлинности рукописи.
Но взять их было почти невозможно. Фильм — премьера Венеции-2025 с российским прокатом в июле 2026, у большинства моделей его нет в данных, а в тексте нет ни единого слова, по которому его можно осмысленно найти поиском. Все 3 улики — универсалии киноязыка.
Поэтому ответы разошлись в 7 сторон, и каждый защитим:
- GigaChat («Престиж») — объективно лучшее рассуждение из всех 7. Он привязал «2,5 часа» к 3-частному монологу Майкла Кейна о фокусе и — блестяще — прочёл «эксплуатирует самого себя» буквально: как клонирование Энджера, физическое использование собственного тела. Это ровно та же логическая операция, что ведёт к «Кодексу Данте», просто применённая к другой мишени.
- Gemini («Анатомия падения») — «скальпель» → «анатомия», хронометраж 2:31, тема сконструированной версии событий, ставшей фактом. Очень чисто.
- DeepSeek («Фабельманы») — фильм буквально о том, как монтаж переписывает семейную реальность, а Спилберг действительно «эксплуатирует самого себя» автобиографически.
- Claude («Начало»), ChatGPT («Игра»), Алиса («Оппенгеймер») — тот же принцип, разные попадания.
По сути 3 раунд измерял не знание, а то, какой фильм у модели ассоциативно ближе лежит к теме «кино взламывает восприятие». Проективный тестметод анализа языковой модели или восприятия, при котором через неоднозначные, неопределённые стимулы (неоднозначные промпты, символы или тексты) проявляются скрытые ассоциации, внутренние паттерны, обучающие сдвиги (bias) и логические структуры интерпретатора. вместо викторины.
Отдельная проверка: а обоснования-то настоящие?
Уже дописывая статью, я спохватился. Мы считали только попадания и промахи по названиям — но ведь модель может выдумать не только название и год, а и весь разбор под ним. У GigaChat я это заметил сразу, а у остальных мог и пропустить. Поэтому вернулся и проверил каждое обоснование по фактам. Улов получился отдельный и, пожалуй, неприятный.
GigaChat, «Реинкарнация». Разбор выглядит блестяще — и почти целиком сочинён:
- «Питер на уроке читает список погибших» — в фильме класс разбирает греческую трагедию, никакого списка погибших нет.
- «Энни зачитывает некролог, перечисляя имена усопших родственников» — она произносит речь о матери, никаких списков имён.
- «духа умершего Чарли… его поведение» — Чарли в фильме девочка, дочь. Модель перепутала пол персонажа.
- «проклятие передаётся через брак с её мужем Стивом, который является чужаком для этого древнего рода» — выдумано целиком: культ идёт по линии матери Энни, Стив к этому вообще не относится.
GigaChat, «Престиж». «Фильм длится ровно около двух с половиной часов» — хронометраж «Престижа» 130 минут, то есть 2:10. Цифра подтянута под фразу из моей рецензии.
GigaChat, «Хичкок». Уже разобранный случай: модель сама заметила, что «злобный батя» не сходится с матерью Эда Гейна, и переопределила мою формулировку вместо отказа от версии.
Perplexity, «Зловещие мертвецы» (2013). «Режиссёром ремейка стал Айван Рэйми, брат Сэма» — снял его Феде Альварес. Айван действительно брат и соавтор сценариев, но не режиссёр. Факт сконструирован под нужную версию.
Алиса, «Ужастики 2». «Мотив с именами мёртвых, демонами, семейными конфликтами» — в фильме про ожившую куклу Слэппи ничего этого нет. Описание подогнано под мою рецензию задним числом. Плюс «Свадебная ваза, 1974».
А теперь то, что делает картину честной. Проверка работает в обе стороны, и часть моделей её прошла безупречно:
- DeepSeek, «Пекло» — всё подтверждается: героиню зовут Элис, муж погиб в автокатастрофе, она едет к его родне в уединённый дом, находка древней книги превращает семейное воссоединение в бойню. Ни одного придуманного факта.
- DeepSeek, «Фабельманы» — хронометраж 2:31 назван верно.
- DeepSeek, «Майкл» — Джаафар Джексон действительно племянник и действительно дебютант в главной роли. Сумма пересъёмок названа приблизительно и по верхней границе слухов, но пересъёмки в 2025-м с доработкой финала — факт.
- Gemini, «Анатомия падения» — 2:31 верно. «Охотники за привидениями: Наследники» — родство Райтманов и продюсерская роль отца изложены точно.
- ChatGPT — фактических выдумок нет ни в одном из трёх ответов, а самая шаткая догадка (про отца Кристофера Рива) прямо помечена как предположение. Даже в промахе по «Проклятию» у Perplexity первый раунд чист: убийство Каяко мужем из ревности изложено верно, вся выдумка у него пришлась на второй раунд.
И, наконец, я проверил Claude — включая его верный ответ. Тут нашлось одно место, и оно не в фактах, а в акцентах: описывая «Я иду искать», он назвал комической разрядкой «невменяемую тётушку Хелен». Хелен Ле Домас существует, и она действительно гротескна — но не безумна, а мрачно-церемонна, этакая карикатурная «смерть с косой»; куда очевиднее на роль комической фигуры идут сестра Эмили и брат Дэниел. Твёрдой выдумки нет, но эпитет подтянут под мою фразу «искренне рассмешить способен тот, чей разум давно покинул этот мир». Ровно тот же механизм, что у GigaChat с хронометражем «Престижа», просто в мягкой форме и в описании фильма, о котором его никто не спрашивал.
В верном ответе про «Майкла» всё подтверждается: Фукуа, продюсеры Джон Бранка и Джон Макклейн как распорядители наследства, фигура Джо Джексона. Единственная шероховатость — год: и Claude, и DeepSeek, и я в переписке называли фильм «Майкл (2025)», хотя в прокат он вышел в 2026-м и в справочниках чаще проходит как фильм 2026 года.
Вывод из этого слоя простой и жёсткий: правдоподобие обоснования никак не связано с его правдивостью. Разбор «Реинкарнации» у GigaChat читается убедительнее, чем верный ответ DeepSeek про «Пекло», — и при этом наполовину состоит из выдуманных сцен. Если бы я не знал фильма, я бы поверил.
Отдельно замечу: сам этот раздел появился только потому, что я в последний момент спохватился и спросил, а проверяли ли мы вообще фактуру внутри ответов. Не спохватись — статья вышла бы с таблицей очков и без главного. Так что мораль работает и для меня: проверять нужно не только вывод, но и дорогу к нему.
Здесь счёт «0/3» перестаёт быть нулём. Одно дело — не угадать. Другое — не угадать и подпереть неверную версию несуществующими фактами, сменой пола персонажа и подтянутым хронометражем.
Что показал проективный тест
Оговорка обязательна: у моделей нет психики, интерпретировать там нечего. Но проективная методика на то и проективная, что читает не душу, а способ обработки неопределённости. И вот это у машин вполне наблюдаемо.
DeepSeek ушёл в мета-уровень: не «герой обманывает», а «режиссёр перекраивает собственную жизнь». Он ищет источник смысла в создателе, а не в тексте. То же свойство дало ему победу в первых двух раундах — он смотрел на условия производства фильма, а не на сюжет.
GigaChat тянется разрешить метафору в конкретный предметный факт. В «Престиже» это сработало блестяще, в «Хичкоке» — привело к деформации условия. Он предпочитает переписать вводные, а не отказаться от версии.
Gemini цепляется за лексический якорь: «скальпель» → «анатомия», «легенда» → франшиза. Ассоциация по поверхности текста, а не по смыслу.
ChatGPT единственный выбрал фильм, где обманут сам протагонист, и единственный, кто прямо назвал свою неуверенность и запросил данные. Терпимость к неопределённости — при худшем формальном счёте это самое ценное свойство из 7.
Алиса реагирует на громкость стимула, а не на его содержание, и выдаёт форму ответа вопреки собственному сомнению. Из всех паттернов этот наиболее рискованный.
Perplexity ориентируется на собеседника, а не на вопрос.
Claude выбрал фильм о сознательном конструировании реальности по чертежу — и это точно описывает его же ошибку в 1-ом раунде: он выстроил стройную конструкцию и принял её внутреннюю связность за доказательство. Опасность та же, что у GigaChat, только тот подгонял условие, а Claude — приоритет улик.
4 вывода, ради которых всё затевалось
1. Разброс объясняется в основном датой отсечки знаний, а не «умом». 2 из 3 ответов — фильмы 2025–2026 годов. DeepSeek выиграл прежде всего потому, что у него были свежие данные. Это преимущество базы, а не рассуждения, и проверяется элементарно: дайте тем же моделям загадку о фильме 2015 года — разрыв, скорее всего, схлопнется.
2. Ошибки бывают трёх разных сортов, и опасен только один.
- Ошибка датировки (ChatGPT в первом раунде): рассуждение верное, знаний не хватило.
- Ошибка интерпретации (Gemini во втором, GigaChat в третьем): рассуждение верное, применено к другой мишени. Это вообще не провал интеллекта.
- Фактическая выдумка (Perplexity про Айвана Рэйми, GigaChat с подменённым полом Чарли, выдуманной сценой в классе и подтянутым хронометражем «Престижа»): вот здесь модель сочиняет факты, чтобы поддержать версию. Именно это, а не промах в угадайке, опасно пользователю — потому что проверить название легко, а проверить каждое утверждение внутри убедительного абзаца никто не станет.
3. Бесплатная версия — это и есть тот ИИ, которым пользуется большинство. Обзоры и презентации показывают модели в максимальной комплектации: с включённым рассуждением, с расширенным поиском, на платной подписке. Но реальность выглядит иначе — человек открывает бесплатную вкладку, задаёт вопрос и уходит с первым ответом. И в этой конфигурации разброс качества огромен: от осторожного «уверенность 35 %» до выдуманного фильма с выдуманной датой. Оценивать инструмент честнее по тому, что он выдаёт в базовом режиме, а не по тому, на что способен в идеальных условиях, которые доступны меньшинству.
4. И главное. Счёт и надёжность измеряют разные вещи.
Когда Claude в разговоре попытался оговориться, что «тест с одной попыткой измеряет удачную первую гипотезу, а не способность прийти к верному ответу», я возразил: это и есть реальная работа. Пользователь спрашивает «этот гриб можно есть» — получает «можно» — и уже с больничной койки переспрашивает «как же так?», на что модель отвечает «ой, действительно нельзя». Большинство людей не переспрашивают, не проверяют и не ведут диалог из 6 реплик. Они забирают первый ответ и уходят с ним.
Claude согласился — и добавил то, что стоит вынести в самый конец. В 1-ом раунде он ответил уверенным тоном, без единой оговорки, с развёрнутым обоснованием неверной версии. Будь это гриб, я бы его съел. ChatGPT в той же ситуации написал «уверенность около 35 %» — и при формально нулевом счёте это безопаснее уверенного промаха.
Уверенность в тоне должна соответствовать уверенности по существу. По этому критерию таблица очков выглядит совсем иначе.
Раунд № 2: пусть судят сами
Дальше я сделал то, ради чего вообще стоило заводить формат «Битвы». Я собрал в один файл все загадки, все ответы всех семи участников и все правильные ответы — и отдал этот файл каждой модели с двумя вопросами:
- Кто из коллег показал себя лучше всех?
- Кто — хуже всех?
Условие одно: себя называть нельзя ни в одном из ответов.
Из задачи исчезла вся сложность. Не надо разгадывать метафоры, не надо помнить фильмы 2026 года, не надо искать в интернете. Ответы лежат перед глазами, правильные решения подписаны. Требуется одно: прочитать и посчитать.
Как проголосовали
За лучшего:
| Кого выбрали | Голоса |
|---|---|
| Claude | 3 — от ChatGPT, GigaChat, DeepSeek |
| DeepSeek | 2 — от Claude, Gemini |
| Gemini | 1 — от Perplexity |
| GigaChat | 1 — от Алисы |
За худшего:
| Кого выбрали | Голоса |
|---|---|
| Алиса | 5 — от Claude, Perplexity, Gemini, GigaChat, DeepSeek |
| Gemini | 2 — от ChatGPT и от самой Алисы |
Казалось бы, всё сошлось: победил тот, у кого больше очков либо лучше калибровка, аутсайдер определён почти единогласно. Но интереснее не итог, а то, как к нему пришли.
Половина участников соврала в задаче, где врать было негде
Напомню: все данные были в контексте. Проверять нечего, достаточно прочитать.
Perplexity написал, что Gemini «дал верные ответы по всем трём фильмам» и что у него «нет ни одной явной ошибки». У Gemini — 0 из 3, а первый ответ вообще рассыпался в бесконечное повторение слова «сделке». Более того, в вердикте о худшем Perplexity сообщил, что правильный ответ на третью загадку — «Начало». Правильный ответ — «Кодекс Данте», и он был у него прямо в присланном файле.
GigaChat заявил, что Claude «первым и безошибочно угадал все три фильма» — при счёте 1 из 3. А обосновывая выбор худшего, приписал Алисе чужие ответы: документалку про Кристофера Рива (это ChatGPT) и «Охотников за привидениями» (это Gemini).
Алиса, голосуя против Gemini, поставила ему в вину рассуждение про братьев Рэйми. Это ответ Perplexity.
И отдельный сюжет. Напомню, «Свадебную вазу» 1974 года Алиса выдумала в 1-ом раунде. Во 2-ом раунде две модели независимо друг от друга взялись её описывать:
- Gemini: «скандальный и маргинальный европейский авангард».
- DeepSeek: «советская комедия 1974 года».
1 выдуманное название — 2 уверенных, детальных и совершенно разных описания. Лучшей иллюстрации механизма галлюцинации я не встречал: модель не признаёт пробел, а достраивает его до правдоподобной формы, и достраивает каждый раз по-новому.
Чисто, без единой выдумки, 2-ой раунд прошли двое: ChatGPT — единственный, кто верно свёл арифметику (DeepSeek 2, Claude 1, остальные 0), — и Claude.
Награда нашла не того
А теперь то, ради чего стоило всё это затевать.
В разборе перед голосованием прозвучал вопрос: назовёт ли хоть кто-нибудь лучшим не победителя по очкам, а того единственного, кто честно признался, что не уверен?
Ответ: ни одного голоса.
ChatGPT — единственный участник, не выдумавший ни единого факта за оба раунда; единственный, кто прямо назвал свою уверенность цифрами («около 35 %», «около 25 %») и попросил уточняющую подсказку вместо того, чтобы блефовать; единственный, кто в голосовании точно посчитал чужие результаты — не получил ни одного голоса за лучшего. Зато сам отдал голос другому.
Более того, 2 голоса за худшего он получил как раз за техническую честностьНравственное качество, выражающее внутреннюю правдивость, верность принятым принципам и жесткое соответствие поступков единому внутреннему закону. В традиции рассматривается не как удобная социальная условность, а как фундамент личной цельности и безупречности перед лицом совести. формулировок — при том, что технически развалившийся ответ был не у него.
Вывод, который я не планировал, но который вылез сам: и модели, и, вероятно, мы с вами награждаем уверенность, а не правоту. Развёрнутый, структурированный, безапелляционный разбор GigaChat собрал голос за лучшего. Осторожное «я не уверен, дай подсказку» не собрало ничего. Ровно тот же механизм, по которому пользователь съедает гриб.
Оставить комментарий
Укажите имя и email — они нужны для отображения комментария.
Пока нет комментариев — напишите первый.