Первый публичный ИИ класса Mythos
Мне дали ранний доступ к первой публично выпущенной модели класса Mythos — Claude 5 Fable. Большинство обсуждений Mythos сосредоточено на его влиянии на безопасность программного обеспечения, но я тестировал его на всём, кроме этого (защитные ограничения Fable фактически запрещают использование для кибербезопасности). Мой вывод: эта модель представляет собой реальный скачок над всеми моделями, которые я использовал раньше — и, что важнее, намекает на кардинальные изменения в наших отношениях с ИИ.
Прежде всего, насколько хорош Fable? В эксперимент за экспериментом он превосходил практически все другие публичные модели, которые я использовал, — и с заметным отрывом. Он был компетентен в широком круге задач и выдавал поразительные результаты: над многостраничными техническими заданиями он работал до двенадцати часов подряд.
Демонстрация возможностей: игры и исследования
Например, Fable создал наиболее изощрённую академическую статью по социальным наукам, которую мне доводилось видеть от ИИ, — из одного промпта и одной правки. Он также создал 10-страничную эпическую поэму в рифму о стрижке, где каждое слово начинается с буквы «s».
В качестве более доступного и развлекательного примера я попросил его создать несколько игр, которые вы можете опробовать. Все они были написаны с одного начального промпта в Claude Code, где Fable должен был взять мои расплывчатые задания и создать что-то работоспособное, — плюс несколько дополнительных промптов с небольшими указаниями.
Попробуйте сами:
Flipside
Игра про подбрасывание монет в стиле Balatro
→ Открыть демо 🐍Змейка 2.0
Змея, которая осознаёт себя — и начинается безумие
→ Открыть демо 🌊Strata Descent
Спускайтесь в глубины и узнавайте, что там
→ Открыть демоИтак, результаты впечатляют. Но, особенно когда я обратился к более серьёзным проектам, работа с инструментом ощущалась как что-то среднее между восхищением и тревогой. Восхитительно — потому что я просто попросил о чём-то, и это произошло. Тревожно — потому что я просто попросил о чём-то, и это произошло.
Изохронная карта: исследование в реальном времени
Чтобы понять почему, полезно разобраться в том, как Fable выполняет работу. Для этого я обращусь к примеру, который тестировал на многих предыдущих моделях ИИ: построение изохронной карты. Это карта, показывающая расстояние, которое можно преодолеть за заданный промежуток времени. Первая такая карта была создана в 1881 году и показывала время в пути из Лондона.
Оригинальная изохронная карта 1881 года
Первая карта, показывающая время в пути из Лондона
Ни одна из предыдущих моделей не справлялась с этой задачей даже наполовину прилично — она требует исследования тысяч потенциальных маршрутов и множества мелких суждений.
Вот мой промпт для Fable через Claude Code:
ИИ сам предложил стилизовать карту под оригинал 1881 года. Я согласился, и он приступил к работе.
Стоит присмотреться к транскрипту многочасовой самостоятельной сессии, потому что там происходит кое-что необычное:
Результатом стала полностью функциональная карта впечатляющей сложности, стилизованная под оригинал 1881 года. Но это не значит, что она была идеальна. Я заметил, что для ряда отдалённых мест (например, Гренландия) содержались лишь приблизительные оценки времени в пути. Поэтому я попросил Fable это исправить:
На этот раз ИИ запустил рабочий процесс с состязательными группами агентов, которые вели исследование и проверяли результаты друг друга. Он выяснил, как часто корабли отправляются на остров Питкэрн в Тихом океане и как добраться до Гриз-Фьорда из Оттавы — и потребил огромное количество токенов в очень короткие сроки.
ИИ решил сложную задачу, объединившую исследования, математику, визуализацию, вкус, суждение, сложное программирование и многое другое. Удивительная часть — насколько мало от меня потребовалось.
Это, вероятно, не самый полезный проект для вас, если вы не очень любите путешествия и карты, — но он показателен: ИИ решает сложную проблему, объединяющую исследования, математику, визуальную разработку, вкус, суждение, сложное программирование и многое другое.
Моя роль была крайне ограничена — не только в объёме работы по сравнению с моделью, но и в степени контроля над тем, как модель делает вещи, почему она выбирает те или иные подходы и даже насколько глубокими будут её результаты.
Детали принятия решений ИИ мне не показываются, а процесс был бы слишком длинным, чтобы следить за ним. Карта потребовала от ИИ принятия суждений по сотням мелких выборов — и он просто делал их, без моего понимания или возможности вмешаться.
Concord: девять с половиной часов работы
Самый амбициозный проект, который мне удалось получить от Fable, требует немного большего объяснения. В моих исследованиях люди часто дают «грязные» ответы, и для их анализа нужно правильно категоризировать эти ответы: насколько инновационна идея? почему людям нравится эта книга? Раньше мы использовали людей-исследователей для вынесения суждений о каждом ответе и статистически сравнивали их ответы с другими.
Недавние исследования показали, что ИИ может выполнять эту важную работу, но калибровка суждений ИИ и человека была сложной и дорогостоящей. Поэтому я попросил Fable решить эту проблему. Сначала он сгенерировал сложный документ с проектным заданием на 19 страниц, а затем приступил к выполнению.
Результатом стало чрезвычайно сложное программное обеспечение, которое ИИ назвал Concord: оно могло принимать несколько наборов данных, калибровать ответы людей и ИИ, а затем проводить сложный анализ данных по результатам.
И снова — не идеально. Как эксперт, я смог обнаружить некоторые ошибки и упущения (часть из-за заданного мной дизайна), которые я попросил ИИ исправить. Но масштаб этого проекта, как и многих других, превзошёл всё, что я видел раньше. В данном случае это было программное обеспечение, которое исследователям было нужно годами, но которое никогда не было достаточно прибыльным для создания.
Программный инструмент для калибровки суждений людей и ИИ при категоризации исследовательских данных — создан за 9,5 часов.
Я уверен, что там не всё идеально (я провёл с результатами лишь час), но программный инженер устранит оставшиеся потенциальные баги, которые я не смог быстро обнаружить. Именно поэтому нам может понадобиться больше, а не меньше программистов в будущем — чтобы помочь с взрывом новых применений для программного обеспечения.
Ограничения и странности
Эта мощь идёт рука об руку со странностью и ограничениями.
Защитные ограничения Fable также срабатывают при малейшем намёке на проблему безопасности, автоматически переключаясь на менее мощный Claude 4.8 Opus — и это происходит слишком часто. А «рваный фронтир» никуда не делся: ИИ всё так же пишет в одном странном стиле (фактически, программное обеспечение Fable носит следы «клодизмов»; то же самое и его отчёты о прогрессе — всё это «нести груз» и «заслуживать ответ»).
Но более глубокая странность состоит в том, насколько мало мне пришлось делать — и насколько мало я мог видеть в процессе работы.
От волшебника к патрону: новые отношения с ИИ
В прошлом году я назвал это работой с волшебником: произносишь заклинание — что-то происходит. С Fable заклинание стало настолько мощным, что я уже не уверен, что являюсь волшебником. Я скорее патрон.
Я описываю, чего хочу, плачу за это, и оцениваю результат. Колдовство происходит где-то там, где я не могу смотреть, — в сотнях мелких решений, в которых я не имею голоса. Работа сместилась от процесса к результату. Я больше не управляю; я заказываю.
Возможно, это отстранение временно — просто артефакт интерфейсов, которые не успевают за развитием, — и мы получим лучшие «окна» в то, что делают эти модели, и лучшие способы управлять ими в процессе. Но также возможно, что верно обратное: чем способнее модель, тем меньше для человека остаётся что-то значимого делать, а «чёрный ящик» — это цена мощи.
Но управление — это уже не то же самое, что делание. Я брифингую модель, она поднимает собственных агентов, чтобы исследовать, писать и проверять работы друг друга, — а то, что возвращается, уже завершено.
Патрон заказывает одного художника. Fable ближе к целой студии, где я — клиент, который утверждает финальную работу, так и не побывав на производстве.
Интерактивный транскрипт
Ниже — полный транскрипт оригинальной статьи на русском языке с возможностью поиска, выделения и навигации по разделам.