Bizibah Павел Гуров

Вопрос, на котором споткнулись все модели

Для «Последнего экзамена человечества» я придумал задачку, которую решает школьник. Ни o1, ни Sonnet, ни Gemini её не взяли.

1 минута чтения llm

Я придумал простой вопрос, на который не смогла ответить даже самая последняя OpenAI o1.

Вкратце суть. В сети начался конкурс вопросов для сложнейшего в мире теста для ИИ. Название конкурса заслуживает отдельного внимания: он называется буквально «Последний экзамен человечества», Humanity’s Last Exam. Учёные из CAIS и ScaleAI запустили его, чтобы собрать самый большой и сложный набор вопросов, которые поставят в тупик современные LLM. Тут можно прочитать подробнее про конкурс: https://habr.com/ru/news/844700/

Понятно, что дедлайны давно прошли, но я решил всё же отправить мой вопрос — и модели на него не ответили.

Мой вопрос:

Decipher the text:

u o y o t
o e h t l
n l e o a
e o b t y
w y a l o
h o i s l

Ответ: be loyal to the one who is loyal to you.

Ключ: текст просто записан по спирали, начиная от центра.

Сетка букв с красной спиралью, раскручивающейся из центра

Я подумал, что супермощные модели сейчас начнут усиленно думать, пытаясь понять сложный шифр, а задачка на самом деле простая. И не прогадал :)

Форма конкурса с вписанным вопросом и точным ответомОтветы GPT-4o, Sonnet 3.5 и Gemini 2.0: все три разбирают шифр по столбцам и диагоналям и выдают бессмыслицуo1-mini сдаётся, o1 отвечает ошибкой. Итог: 0 из 5 моделей ответили верно