Как устроены испытания

Автор представляет GPT-6 Astra через серию собственных испытаний, а затем переходит к опубликованным результатам тестов и условиям доступа. Основную часть работы он выполняет в настольном приложении ChatGPT, которое называет прежним Codex: по его объяснению, там агенты могут одновременно заниматься несколькими проектами и работать с сохраняющимися локальными файлами. Вместо привычных демонстраций он выбирает задачи с физикой, анимацией, управлением интерфейсами и созданием законченных материалов. Он также неоднократно поручает отдельному агенту оценивать результат и возвращать исполнителю список недостатков для следующей попытки.

Симуляция пули и воды

Первое испытание — написанная с нуля симуляция пули, пробивающей наполненный водой воздушный шар. После разрыва вода должна менять форму и падать на землю; изображение требуется сделать максимально реалистичным и физически точным. Автор запрещает внешние веб-библиотеки, в том числе названную в запросе библиотеку для 3D, и просит реализовать остановку в любой момент, свободный выбор ракурса и ползунки скорости пули, размера шара, освещения и гравитации. Отдельный критик должен делать снимки с разных сторон и оценивать физику и реализм по шкале от 0 до 10. Проходной результат — не менее 8 баллов, число попыток ограничено тремя; для запуска выбран режим «ultra».

Задание для GPT-6 Astra с отдельным агентом-критиком и тремя раундами исправлений
Автор задаёт отдельному агенту-критику шкалу, проходной балл и максимум три раунда исправлений.Кадр: 02:02

Работа над симуляцией занимает 32 минуты. Первый вариант критик оценивает в 4,7 балла, второй — в 6, третий — в 6,5. Ни один не достигает заданных 8, но после третьего раунда процесс останавливается в соответствии с ограничением. В полученном приложении автор меняет диаметр шара, скорость пули, высоту попадания, гравитацию, поверхностное натяжение и плотность брызг. Он передвигает временную шкалу, показывает прохождение пули через воду, падение воды, виды сбоку, сверху и снизу, меняет интенсивность и направление света. Итог он считает достаточно прилично выглядящей симуляцией, написанной без внешних библиотек. Число использованных токенов показать нельзя: приложение не выводит статистику сессии. При нескольких одновременно запущенных задачах расход именно на эту работу он предполагает на уровне 3–4% недельного лимита.

Игра в Unreal Engine

Следующая задача — процедурная игра в Unreal Engine с управлением персонажем от третьего лица. Автор считает демонстрации шутеров и гонок менее показательными, поскольку в них, по его мнению, сравнительно мало сложной анимации и сочленённых движений. Здесь же модель должна взять персонажа со Sketchfab, найти анимации в Mixamo и перенести их на него: героиня должна быстро бегать и прыгать по крышам, подобно ниндзя. Для доступа к требующим авторизации материалам разрешается использовать расширение Playwright и уже открытый Chrome, в котором автор вошёл в аккаунт. Окружение задаётся как древнекитайский императорский комплекс; визуальным ориентиром служит заранее сгенерированное изображение. Все объекты требуется создавать через Blender MCP и процедурно размещать в Unreal Engine, добиваясь подробной, реалистичной и величественной сцены, сопоставимой по впечатлению с AAA-игрой.

Критик игры должен самостоятельно получать снимки с нескольких ракурсов и при разном масштабе, оценивать дизайн и внешний вид от 0 до 10 и передавать упорядоченный список исправлений. Условие успеха — оценка выше 8,5 при отсутствии ошибок, предел — четыре раунда. Первый этап занимает час и 26 минут: агент скачивает персонажа, добавляет позы бега и нахождения в воздухе, связывает движение с Unreal и создаёт здания. Критик отмечает пустоватую сцену, чрезмерно металлические крыши, повторяющуюся планировку и грубые дальние горы. После доработки второй вариант получает 5,8 балла; в последнем раунде оценка достигает 6,3. Порог опять остаётся недостигнутым, а особенно неудачными автор считает движения персонажа.

Автор продолжает работу отдельными уточнениями. Он требует более подходящих анимаций Mixamo, наклона вперёд при быстром беге и прыжках, новых проверок критиком — снова максимум четыре раунда — и выразительного движения камеры. Слишком высокий одиночный прыжок нужно уменьшить, зато разрешить цепочки прыжков в воздухе; бег и прыжковые анимации должны воспроизводиться вдвое быстрее. Дополнительно запрошены тряска камеры, размытие движения, ветер или туман, более эффектный и реалистичный свет, разнообразные здания и бесконечный процедурный дворец. После примерно четырёх часов автор показывает игру, где можно ходить, бегать, перелетать между крышами цепочками прыжков и собирать добавленные агентом парящие значки. Внешний вид ему нравится, хотя отдельные этажи зданий и фонари остаются отсоединёнными. Он показывает также каркасный вид и сцену с одним освещением. Расход за примерно четыре часа оценивает приблизительно в 10% недельного лимита, вновь без доступной статистики сессии.

Рисование и исполнение музыки через интерфейс

В испытаниях управления компьютером автор сначала упоминает заполнение налоговых форм и редактирование файлов Microsoft Office, затем показывает рисование в Photopea. Агент должен открыть сайт, создать пустой холст и максимально подробно воспроизвести приложенную картинку. В ускоренной записи видно рисование отдельными мазками; автор подчёркивает, что здесь используется курсор, а не программное построение изображения. Процесс занимает примерно 20 минут. Далее он поручает агенту в другом веб-редакторе нарисовать покадровые спрайтовые анимации по изображению персонажа: бег, прыжок и взмах мечом, каждую из четырёх кадров, с сохранением в отдельный GIF. Примерно за 40 минут агент последовательно рисует движения кадр за кадром и выдаёт три анимации.

Более сложной проверкой управления интерфейсом автор считает игру на виртуальном пианино. В запросе требуется включить максимальное число видимых клавиш, сочинить быстрое соло в стиле Шопена продолжительностью около минуты и исполнить его нажатием клавиш онлайн-клавиатуры. Помимо сочинения здесь нужно выдержать время между последовательными нажатиями, а не просто воспроизвести готовый звук в музыкальной программе. Несколько минут агент разбирается с клавиатурой и записью исполнения; автор предполагает, что сначала проходит короткая репетиция. Затем звучит итоговая пьеса. Он говорит, что она производит впечатление настоящего классического фортепианного соло, и отмечает общую длительность работы около семи минут.

Композиция в Waveform

Полноценную музыкальную композицию автор заказывает в музыкальном редакторе Waveform: танцевальную электронную музыку в стиле европоп с самостоятельно выбранными инструментами, доступными музыкальными плагинами VST и сэмплами, вариациями, нарастаниями, выразительными переходами к основной части трека, панорамированием, эффектами и автоматизацией. Запрос также требует профессионального сведения и мастеринга. Первый рендер появляется через 15 минут, но автор считает его простым и любительским, а звучание этого перехода — ненатуральным. Во втором запросе он разрешает бесплатные сэмплы с samplefocus.com, просит больше интересных звуковых деталей и более запоминающуюся мелодию. Ещё примерно через 20 минут звучит доработанная версия. Она нравится ему значительно больше результатов, ранее полученных от Claude и GLM, однако он отдельно отмечает дополнительное уточнение и разрешение искать новые сэмплы. Даже улучшенный трек, по его оценке, звучит мутновато, недостаточно хорошо сведён и уступает профессиональному человеческому мастерингу.

Реконструкция здания в Blender

Для проверки 3D-реконструкции автор передаёт целую страницу объявления Airbnb о дорогом жилье в Японии. Он обращает внимание на наклонную стену возле бассейна, необычный деревянный объект, ванную, внешний вид здания, гостиную, длинный основной бассейн и меньший круглый бассейн, диван и стол. Агент должен через Blender MCP восстановить здание вместе с интерьером, запрограммировать движение камеры для виртуальной экскурсии и отрендерить сцену. Работа занимает час и 12 минут; предполагаемый расход — 5–10% недельного лимита. В сцене создаются тысячи элементов. Автор показывает ванную, зону бассейнов и гостиную в каркасном и обычном режимах, затем полный рендер рядом с фотографиями объекта. Результат он считает вполне приличным, хотя полного соответствия оригиналу не видит.

Рекламный и математический ролики

Ещё одна задача проверяет роль модели как постановщика, управляющего другими генераторами. Автор говорит, что такие модели сами не создают изображения и видео, но могут руководить специализированными средствами. Он передаёт страницу продукта на Amazon и просит сделать 30-секундный рекламный ролик, используя фотографии и характеристики как ориентир. Контент нужно получать через MCP платформы Higgsfield; разрешается выбрать подходящие генераторы изображений и видео, сделать несколько клипов и соединить их. Через примерно 20 минут появляется законченный ролик. Его автор оценивает значительно выше результата Claude Fable 5.1, полученного по тому же запросу.

Затем агент создаёт с нуля примерно минутное математическое объяснение того, как впервые определили окружность Земли. Требуются минималистичная белая графика на чёрном фоне, диаграммы, понятное изложение и достаточно подробное объяснение математики. Инструменты можно выбирать свободно; для озвучки автор предписывает Gemini TTS и передаёт документацию. Первый вариант после 14 минут он считает приемлемым, но просит улучшить его с помощью критика: не менее 8 баллов, максимум три раунда. Позднее он отдельно требует более связного текста, подходящего для объяснения старшеклассникам. В итоговом ролике изложен метод Эратосфена около 240 года до нашей эры: в полдень летнего солнцестояния в Сиене палка почти не даёт тени, а в Александрии тень есть. Отношение длины тени к высоте палки даёт тангенс угла; современное объяснение предлагает найти угол обратным тангенсом. Угол около 7,2° переносится на угол между радиусами Земли при почти параллельном солнечном свете. Это одна пятидесятая полного круга в 360°; расстояние примерно 800 километров, умноженное на 50, даёт около 40 000 километров. Сам ролик оговаривает приблизительность измерений.

Поиск лягушки и распознавание опухолей

В онлайн-интерфейсе автор переходит на вкладку Work и проверяет поиск скрытой лягушки на фотографии. Он просит определить и обвести животных и выбирает режим «max». После 6 минут 50 секунд модель не находит лягушку: сообщает, что не может уверенно определить животное, и предполагает гремучую змею, что автор называет ошибкой. Он упоминает сообщения пользователей об успешном решении, но говорит, что повторить его не смог при нескольких запусках. В другом ответе модель ошибочно указывает маленькую жабу; на ещё одной фотографии из Frogbench также обводит неверное место. По результатам своих попыток автор заключает, что лягушачий тест не пройден.

Ошибочный ответ GPT-6 Astra на изображение со спрятанной лягушкой
Astra сообщает, что не может уверенно определить животное, но всё же отмечает участок как возможную змею. Настоящая лягушка находится в другом месте.Кадр: 24:00

Следом он загружает шесть изображений мозга, каждое, по его словам, с отдельным типом опухоли, и просит назвать опухоли, если они есть. Работа занимает две с половиной минуты. Верхнее левое изображение модель правильно определяет как менингиому. Для верхнего среднего она не видит определённой опухоли, для верхнего правого снова называет менингиому; нижнее левое и шестое считает изображениями без опухоли, а для нижнего среднего предлагает кальцифицированную менингиому или обозначенный в ответе вариант «cranio». Все эти пять ответов автор считает неверными. Итог — один правильный ответ из шести, столько же, сколько у Kimi и GLM, и это, по его сравнению, наивысший результат для данного запроса.

Исследование и новые идеи

В исследовательской задаче требуется разобрать распространение амилоида-бета и тау при болезни Альцгеймера, сопоставить направленные на них терапии и критически оценить результаты недавних испытаний третьей фазы, добавив таблицы и визуализации. Автор считает, что единственного правильного ответа здесь нет, а большинство передовых моделей, кроме Claude, справляются хорошо и различаются прежде всего подачей. В ответе Astra он показывает таблицу механизмов, ссылки на источники, схему связей, таблицу испытаний третьей фазы, созданную программно иллюстрацию и ещё одну насыщенную таблицу. Его положительная оценка относится к краткости и плотности информации.

Последний собственный запрос — три ещё не существующие идеи с наибольшим воздействием на качество жизни животных промышленных ферм, реализуемые нынешними технологиями и ИИ. Ограничения требуют существенного улучшения, охвата огромного числа животных, малых затрат труда и эксплуатации и очевидной привлекательности для операторов. После 8 минут 35 секунд модель предлагает создавать и защищать зоны отдыха кур, адаптировать обогащение среды свиней к спросу и конкуренции и сохранять совместимые группы свиней при обычных перемещениях. Для первой идеи перечислены менее прерываемый отдых, больший выбор окружения, возможная экономия корма и меньше проблем с ногами. Автор прямо признаёт субъективность оценки этих предложений.

Приведённые тесты и игровые достижения

Переходя к тестам, автор сначала обозначает результаты как сообщаемые разработчиками. Он приводит примерно 98% на Frontier Math и лидерство Astra на Terminal Bench 4, Automation Bench, Agents last exam и OS World. Эти испытания он связывает соответственно со сложной математикой, работой агента в терминале, многоэтапными деловыми процессами, профессиональными задачами и действиями в компьютерных приложениях. Заявление о лучшей в мире модели для управления компьютером он передаёт как чужое заявление. Он также показывает лидерство в восстановлении 3D-объектов по разным видам и улучшение относительно предыдущей GPT на String Quartets, где аудио переводится в нотную запись.

Среди приведённых игровых достижений автор называет Astra единственным на тот момент универсальным агентом, прошедшим Portal. Он объясняет значимость пространственным мышлением, пониманием физики, многошаговым планированием и точным временем действий мышью и клавиатурой. Для Pokémon Fire Red приводится время 18 часов 12 минут, существенно меньшее, чем у остальных моделей. Автор связывает прохождение с долговременным планированием, памятью, зрением и тысячами согласованных решений. Затем он упоминает трансляцию Pokémon Crystal на Twitch и высказывает предположение о будущем рекорде; завершённого результата Crystal в выступлении нет.

На ARC AGI-3 автор приводит результат более 60% против менее 10% у других передовых моделей и почти 100% с дополнительной программной оболочкой. Он описывает испытание как освоение правил незнакомой среды и объясняет трудность для моделей фиксированными после обучения весами. На Voxel Bench для трёхмерных воксельных анимаций Astra, по показанной таблице, первая и опережает Opus 5 почти на 400 пунктов, тогда как остальные различаются на несколько десятков. На одном из приведённых тестов Frontier Math она единственная получает больше 0% за задачи, которые автор описывает как ранее нерешённые. На iBench, проверяющем зрение через лабиринты, поиск отличий, графики и закономерности, приводится 95% против менее 50% у других. Он также отмечает первое место в головоломках Connections от New York Times.

Не все приведённые таблицы ставят Astra первой. В Artificial Analysis Intelligence Index версия Max занимает второе место после Claude Fable 5.1; при этом стоимость задания автор считает разумной, а Claude — чрезмерно дорогой. По показанному показателю Omniscience у моделей GPT-6 меньше галлюцинаций, чем у Opus 5, моделей Fable и прежней GPT-5.6. В LiveBench Astra третья, ниже Fable. В Arena она ещё не добавлена в некоторые категории, но в WebDev автор показывает первое место с большим отрывом. Эти сравнения сопровождают его общую высокую оценку возможностей модели.

Доступ и расход недельного лимита

В конце автор говорит, что к моменту записи доступ должен быть распространён на все платные планы ChatGPT, включая Plus и Pro. Сам он пользуется Pro 5X: в обычном онлайн-чате выбрать GPT-6 у него не получается, зато она доступна на вкладке Work и в настольном приложении. Недельный лимит своего тарифа он считает разумным и оценивает обычную часовую задачу программирования примерно в 5–10% этого лимита; для Plus предполагает заметно более быстрый расход. Итоговое утверждение о самой способной и мощной доступной модели остаётся его собственной оценкой, основанной на показанных испытаниях и приведённых сравнениях.