Неделя в изложении автора вместила сразу несколько последовательных выпусков языковых моделей: DeepSeek с поддержкой изображений, обновление Alibaba, Fable 5.1 от Anthropic, Gemini 3.8 Flash от Google, MuseSpark 1.3 от Meta и GPT-6 Astra от OpenAI. Последнему он уделяет особенно много внимания и считает его самым впечатляющим выпуском этой череды. Одновременно появились проекты интерактивных миров, ускорения видеогенерации, создания и редактирования изображений, прогнозирования временных рядов и погоды. Обзор движется от отдельных технических разработок к большим моделям, а затем возвращается к исследовательским и визуальным системам.
Интерактивные миры H3-World и SolarWM
Первый проект, H3-World, превращает видеогенератор MiniMax H3 в подобие интерактивного игрового движка. В описанных демонстрациях пользователь задаёт текстовый запрос и нажимает клавиши, а система генерирует видео с соответствующим движением или взаимодействием. Для этого разработчики не строят отдельную систему управления с нуля: нажатия переводятся в короткие английские описания, которые поступают в уже имеющийся у MiniMax слой понимания языка. Каждая команда связывается с конкретным участком видео, где должно произойти действие. Проект уже опубликован; доступны инструкции по локальному запуску и скрипт обучения.
SolarWM решает похожую задачу: преобразует видеомодели в интерактивные миры, генерируемые в реальном времени. Автор выделяет заявленную способность сохранять последовательность происходящего более часа и противопоставляет её системам, у которых мир начинает распадаться спустя несколько минут. Программная среда работает с WAN 5B, WAN 14B, LTX 2.5 и MiniMax H3, поэтому подход не привязан к единственному генератору. Команда собрала 1,3 миллиона видеоклипов общим объёмом 25 терабайт и выпускает этот набор бесплатно. Открыты также модели для перечисленных генераторов, обработка данных, рецепты обучения и остальные части проекта. Автор показывает страницы, где доступны датасет и сохранённые веса моделей.
Прогнозирование временных рядов
Google Research выпустила TimesFM-3 — базовую модель прогнозирования числовых временных рядов без дополнительного обучения под новую задачу. Автор перечисляет ритейл, здравоохранение, погоду и биржевые графики как примеры таких данных. Основное обновление — многомерность: модель рассматривает несколько связанных сигналов вместе. При размере 330 миллионов параметров её предварительно обучили на более чем триллионе временных точек. Особенно значимой автор считает возможность дать ей ранее не встречавшуюся задачу прогнозирования и получить предсказание без переобучения. По приводимым им результатам Google, модель заняла первое место среди базовых моделей временных рядов на нескольких тестах. Проект открыт, инструкции размещены на GitHub, веса — на Hugging Face. Названный размер составляет 1,32 гигабайта; автор предполагает, что такая модель поместится на большинстве потребительских устройств.
Редактируемая трёхмерная комната
Lucida от ByteDance создаёт редактируемую трёхмерную сцену по фотографиям реальной комнаты, в том числе беспорядочной. Вместо единого слитого скана система выделяет отдельные предметы, строит для каждого полноценный 3D-объект и возвращает их на исходные места. Поэтому каждый предмет остаётся отдельной сеткой: его можно перемещать, менять размер или редактировать. Процесс описан в три этапа: разбор комнаты на объекты, восстановление их полных форм, включая части, скрытые на фотографиях, и определение положения в сцене. На момент обзора опубликована только техническая статья.
Ускорение MiniMax H3
VideoDeltaNet — ещё один открытый проект для ускорения MiniMax H3. По объяснению автора, в полной модели механизм внимания занимает около 85% времени работы. Новый вариант использует гибридную схему: для близких кадров сохраняется более дорогой механизм внимания, важный для деталей и движения, а информация из удалённых кадров обрабатывается более дешёвым линейным вниманием. Он сравнивает это с подробной обработкой ближайшего окружения и сжатой памятью обо всём дальнем. В сочетании с оптимизированными вычислительными ядрами, параллелизмом и дистилляцией до восьми шагов это, по показанным материалам, даёт значительное ускорение при небольших потерях качества.
В сравнительных роликах автор сопоставляет исходный MiniMax H3, другой метод ускорения Fast H3 и новый VDN H3. По его визуальной оценке, Fast H3 заметно меняет качество, а VDN H3 остаётся очень близок к полной модели. Приведённый результат быстрее реального времени требует восьми NVIDIA B200: 14-секундный клип создаётся за 11 секунд. Для потребительской видеокарты автор прямо оговаривает, что реального времени не получится. Ускорение он сравнивает с Turbo LoRA, но качество считает существенно лучше. Модель и код опубликованы, есть инструкции по локальному запуску. Также уже сделаны пользовательские узлы ComfyUI, позволяющие включить VDN H3 в существующий процесс работы с MiniMax.
Генератор и редактор LLaDA-Image
Следующий открытый генератор и редактор изображений — LLaDA-Image. Автор показывает фотореалистичные изображения, а также плакаты и инфографику со множеством текстовых и графических элементов. В примерах редактирования меняются выражение лица и поза персонажа, заменяются части изображения и текст, раскрашиваются фотографии. Модель содержит шесть миллиардов параметров; по размеру автор сопоставляет её с ZImage. Опубликованы базовая версия, предназначенная преимущественно для обучения либо более качественной генерации и требующая 50 шагов генерации, и ускоренная Turbo, которой достаточно четырёх шагов. Для обеих есть варианты BF16 и FP8. Трансформер Turbo FP8 занимает примерно 6,7 гигабайта; автор ожидает, что он поместится на большинстве потребительских видеокарт. Инструкции по скачиванию и локальному запуску доступны.
DeepSeek с поддержкой изображений
DeepSeek v4 Flash Vision Experimental добавляет работу с изображениями. В приведённом сравнении модель в большинстве случаев превосходит прежнюю v4 Flash без Vision, а её уровень автор приблизительно сопоставляет с Opus 4.8. Сначала, за неделю до рассматриваемого выпуска, она появилась через API; теперь её открыли для скачивания и бесплатного локального запуска через Hugging Face. При этом речь идёт о большой модели: 305 миллиардов параметров и примерно 168 гигабайт общего объёма. Автор показывает страницу с инструкциями по запуску.
Обновление Alibaba Max 0902
Alibaba обновила Qwen3.8 Max, до версии Qwen3.8-Max-0902; обозначение соответствует 2 сентября. Архитектура осталась прежней: 2,4 триллиона параметров и контекстное окно в миллион токенов. Изменение связано с дополнительным обучением для программирования и совместной работы. Автор подчёркивает, что первоначальная 3.8 Max вышла всего несколько недель назад, однако обновление существенно улучшило результаты. На отдельных тестах агентного программирования прибавка превышает десять процентных пунктов. В части тестов агентной работы и работы со знаниями новый вариант опережает Opus 5 и GPT 5.6 Sol. Открытых весов пока нет; доступ предоставляется через API облачной платформы Alibaba.
Fable 5.1 и ограничения доступа
Anthropic представляет Fable 5.1 как особенно сильную модель для агентных научных исследований, программирования и работы со знаниями. В показанной таблице она существенно опережает Fable 5 и GPT 5.6 Sol, а в независимом рейтинге вариант Fable 5.1 Max получает наивысший результат, выше Opus 5 и GPT 5.6. Вместе с тем автор обращает внимание на стоимость: выполнение задачи обходится более чем в 3,7 раза дороже, чем у GPT 5.6 Max. Его личный опыт оказался неудовлетворительным. На подписке Max один или два простых запроса исчерпали пятичасовой лимит. При многочисленных запросах на глубокое исследование и медицинские темы сервис, по его словам, отказывался использовать Fable 5.1 и переключался на Opus 5. Автор считает, что на его аккаунте эти ограничения мешают использовать модель для исследований.
Gemini 3.8 Flash и Cyber
Google выпустила Gemini 3.8 Flash и 3.8 Flash Cyber. Автор подчёркивает, что это семейство Flash, однако в показанных результатах по финансовым и юридическим задачам, а также агентному программированию в терминале обычная версия опережает Opus 5 и GPT 5.6 Sol. Он также отмечает высокие результаты понимания научных изображений и графиков, длинных видео, сложных знаний в Humanity’s Last Exam, биоинформатики и биологических исследований. В тесте длительной агентной разработки программ Gemini занимает первое место при средней стоимости ниже других передовых моделей. Но есть существенная оговорка: по тому же сравнению она генерирует намного больше выходных токенов, чем конкуренты.
Другие рейтинги Gemini дают более неоднородную картину. В Artificial Analysis её результат на один балл ниже GLM 5.3 и на несколько баллов ниже ведущих Claude и GPT. При этом автор приводит скорость до 348 токенов в секунду и считает стоимость задачи умеренной. В Arena модель занимает восьмое место, а в LiveBench не входит даже в первую десятку и находится ниже Gemini 3.7 Flash. Из этого расхождения он высказывает подозрение, что модель могла быть слишком ориентирована на тесты. Среди демонстраций — трёхмерная игра с волшебником, разрез и топографическая карта на основе реальных данных, а также объёмная клавиша механической клавиатуры, которую можно разложить на детали.
Gemini 3.8 Flash Cyber специализируется на поиске и исправлении уязвимостей. В показанных тестах поиска уязвимостей она превосходит GPT 5.6 Sol. Согласно пересказываемому заявлению разработчиков, защитная версия создала в 2,6 раза больше правильных исправлений уязвимостей Chrome, чем лучшие коммерческие модели значительно большего размера. Обе версии уже доступны через API, среду агентного программирования Antigravity, AI Studio и Android Studio. Для потребителей обычная 3.8 Flash доступна платным подписчикам в приложении Gemini, а также в AI Mode поиска Google и Gemini в Google Sheets.
MuseSpark 1.3
Через несколько часов после Google Meta представила MuseSpark 1.3. По показанным тестам работы со знаниями и агентного программирования модель находится близко к передовому уровню, а в отдельных испытаниях превосходит GPT 5.6 Sol. Основной акцент выпуска — длительные, сложные задания с открытой целью, множеством файлов, инструментов и последовательных шагов. Модель должна самостоятельно собирать информацию, планировать, исправлять свои действия и доводить работу до готового результата в разных платформах. Отдельно описано улучшение многозадачности: несколько заданий внутри одного разговора должны выполняться без смешивания относящихся к ним инструкций. На момент выступления MuseSpark 1.3 доступна в платформе Muse Code и через API моделей Meta.
GPT-6 Astra
GPT-6 Astra автор описывает как модель для гораздо более продолжительных и сложных реальных задач, включая непосредственное управление компьютером и курсором. В демонстрациях она превращает принципиальную электрическую схему в пригодную для изготовления печатную плату, выполняет работу в Excel, создаёт городскую сцену с нуля в Unity и строит модель пятиступенчатой автомобильной коробки передач в FreeCAD, после чего анимирует движение шестерёнок в Blender. Ещё один пример — заполнение налоговых и других форм прямо в браузере. Позднее показан дом, смоделированный в Blender и превращённый в доступную для прогулки сцену Unreal Engine. Эти примеры автор приводит как иллюстрации разнообразия операций, которые модель выполняет через программы.
В таблицах GPT-6 Astra получает ведущие результаты в Agent’s Last Exam, OSWorld для работы с реальными компьютерными интерфейсами и BenchCAD для восстановления трёхмерных объектов по различным видам. Самое большое улучшение автор связывает с управлением компьютером. Он также показывает тест перевода музыкального аудиофрагмента в нотную запись, отмечает результаты дизайна выше Fable 5.1 и Opus 5 и лидирующий показатель Terminal Bench 4 на сложных задачах программной разработки в терминале. В научных и медицинских тестах он перечисляет GPQA Diamond, Health Bench и LifeSci Bench как свидетельства передового уровня. В Exploit Bench назван результат 100%; в Exploit Gym автор отмечает превосходство по результативности и эффективности над предыдущей GPT.
Однако независимые сводные рейтинги не полностью соответствуют его впечатлению. В Artificial Analysis Intelligence Index Astra занимает второе место после Fable 5, а в LiveBench — третье, также ниже Fable 5. Автор считает, что по его опыту GPT-6 работает несколько лучше Fable 5.1, и сомневается в четвёртом месте MuseSpark. Он предполагает чрезмерную ориентацию результатов на тесты и допускает, что индекс интеллекта следует пересмотреть. По приведённому сравнению стоимости задач Astra существенно дешевле Claude при сходном уровне интеллекта — так автор интерпретирует таблицу цен и результатов.
Особенно подробно он останавливается на ARC AGI 3, где агент попадает в незнакомую игровую среду и должен самостоятельно определить правила, пройти игру либо перейти на следующий уровень. Трудность для модели автор объясняет фиксированными после обучения весами и необходимостью применять новые сведения. У большинства передовых моделей в показанном сравнении результат ниже 10%, тогда как Astra при максимальном усилии рассуждения получает более 60%. С дополнительным адаптером или управляющей оболочкой результат приближается к 100%. В одном из приведённых тестов Frontier Math Astra оказывается единственной моделью с результатом выше нуля на чрезвычайно сложных нерешённых математических задачах; остальные получают 0%.
Astra также автономно проходила Pokémon Fire Red; за игрой можно было наблюдать в прямой трансляции Twitch. По приведённому сравнению ей потребовалось меньше времени, чем предыдущим моделям. Неожиданная деталь — режим Astra High оказался быстрее Astra Max. Доступ автор описывает с привязкой ко времени выступления, субботе: GPT-6 Astra должна быть развёрнута для всех платных планов, включая Plus и Pro. На бесплатном плане доступа ещё нет.
WeatherNext 3
WeatherNext 3 от Google DeepMind обновляет прогнозирование погоды за счёт свежих спутниковых наблюдений. Автор объясняет, что вместо преимущественной опоры на погодные симуляции, которые могут быть уже на несколько часов устаревшими, система получает недавние данные об атмосфере и каждый час создаёт новый глобальный прогноз. WeatherNext 2 использовала сетку 25 километров и обновление раз в шесть часов; новая версия прогнозирует, в частности, температуру поверхности и влажность с разрешением до пяти километров. Автор связывает более подробную сетку с лучшим отражением условий в горах, на побережьях, при штормах и локальных дождях. В спутниковом тесте осадков он приводит улучшение до 60% относительно предыдущей версии.
WeatherNext 3 также прогнозирует скорость ветра примерно на высоте ветряных турбин и количество солнечного света, достигающего солнечных электростанций. По сообщению в обзоре, интеграция в поиск Google, приложение Gemini, Google Maps, API и Google Earth Engine начинается уже на рассматриваемой неделе. Для этих продуктов автор отдельно упоминает повышение точности прогнозов осадков до 50%, наряду с другими улучшениями.
Карта нервной системы плодовой мушки
Другой проект Google Research — полная карта мозга и центральной нервной системы самца плодовой мушки. Разработчики называют её крупнейшей созданной картой нейронных связей. Она содержит более 166 тысяч нейронов и около 125 миллионов синапсов, включая не только мозг, но и брюшную нервную цепочку, которую автор приблизительно сопоставляет со спинным мозгом человека. Такая полнота позволяет прослеживать путь сигналов зрения, обоняния и слуха от разных частей тела через мозг к управлению движениями. Для реконструкции нервную систему разрезали на огромное число очень тонких срезов, фотографировали электронными микроскопами и с помощью вычислений и ИИ восстанавливали трёхмерные нейроны и связи.
Автор подчёркивает трудоёмкость такой работы и сравнивает масштаб: у мушки 166 тысяч нейронов, у человека — 86 миллиардов. По его словам, при нынешней технологии построить столь подробную карту всего человеческого мозга пока нельзя. Исследователи уже картировали и самку плодовой мушки, а следующим направлением называют мозг личинки данио-рерио. Автор видит в подобных биологических схемах возможность лучше понять связь нервных цепей с поведением и допускает, что они могут дать идеи для систем ИИ и роботов.
Atlas от World Labs
World Labs, основанная Фэй-Фэй Ли, представила предварительный показ модели мира Atlas. Она принимает текст, изображения, видео и трёхмерную информацию, объединяя их для создания или восстановления 3D-мира. В одном примере по входному видео и вручную нарисованной траектории камеры создаётся до минуты согласованного видео в разрешении 1440p. Автор характеризует управление как попиксельно точное и отмечает, что при остановке на любом кадре сцена выглядит последовательной, в том числе при смене ракурса и насыщенном движении. В другом примере реальное место восстанавливается по нескольким фотографиям. Atlas может выдавать и явную геометрию — облака точек или Gaussian splats. Автор упоминает виртуальные экскурсии по недвижимости и синтетические данные для роботов как возможные применения. Пока это только предварительный показ; ранний доступ запрашивается через форму.
InternLumina-U2
InternLumina-U2 объединяет генерацию, редактирование и понимание изображений. В примерах есть реалистичные фотографии и масляная живопись, изменение или удаление частей картинки, а также точное выполнение инструкции повернуть только оранжевые квадраты. Автор описывает систему как диффузионную большую языковую модель с визуальным пониманием. Среди приведённых демонстраций анализа — распознавание дефекта миграции нейронов на медицинском снимке, определение художника по картине и ответы на вопросы по сложной схеме связей в базе данных. Это представлено как примеры возможностей модели. Код и инструкции локального запуска уже опубликованы, но загрузки весов на Hugging Face на момент выступления ещё ожидают.
Замена персонажа в видео
Viggle Animate заменяет персонажа видео по одному отредактированному кадру. В описанном процессе персонажа меняют редактором изображения, например в первом кадре, затем модель распространяет замену на весь ролик, сохраняя исходные движения. Автор отмечает отсутствие необходимости отдельно оценивать позу, сегментировать изображение или отслеживать лицо. Подход работает с персонажами разных пропорций и художественных стилей, не ограничиваясь реалистичными людьми. Это дообученный и дополнительно дистиллированный вариант MiniMax H3, создающий видео по исходному изображению. Опубликованы полная дообученная модель размером около 66 гигабайт и меньший вариант размером 2,5 гигабайта. Инструкции скачивания и запуска доступны.
Интерактивный мир Runway
Последняя новинка — модель Runway GWM Worlds 2. По исходному изображению или описанию она генерирует интерактивный мир, где можно перемещаться от первого или третьего лица, задавать персонажа и окружение, менять погоду и управлять действиями других персонажей либо объектов. Выход — непрерывное видео 720p с частотой 24 кадра в секунду. Особенность, которую выделяет автор, — отсутствие фиксированного максимального времени работы. Систему он описывает как авторегрессионную диффузионную модель видео и аудио, которая использует уже созданный мир для последовательного предсказания его продолжения. На момент обзора это исследовательский предварительный показ: общедоступного запуска нет, для связи с командой нужно заполнить форму.



