Восемь часов ModCon начались с языка программирования и закончились видео, в котором изображение и звук создаются одновременно. Между ними говорили о новых ускорителях, цене ответов, сбоях серверов и нехватке электричества. Полная запись конференции длится 8 часов 13 минут; почти два часа занимают перерывы, остальное — основной доклад, панели и короткие технические выступления.

В программе основной сцены всё это называлось разговором о едином слое вычислений для ИИ. Если проще: Modular хочет, чтобы одну и ту же модель можно было переносить между разными чипами без полной переделки программ.

Это была конференция самой Modular, поэтому её цифры скорости и экономии нельзя принимать за независимое сравнение. Но выбранная тема хорошо показывает, куда сместилась конкуренция. Хорошую модель мало обучить. Её ещё нужно быстро, надёжно и не слишком дорого обслуживать для тысяч пользователей.

Qualcomm купила недостающий кусок

29 июля, за три недели до конференции, Qualcomm завершила покупку Modular. На сцене глава Qualcomm Кристиано Амон объяснял уже не возможное партнёрство, а устройство объединённой компании. У Qualcomm есть процессоры и ускорители для устройств и дата-центров; у Modular — программы, которые должны сделать это оборудование удобным для разработчиков моделей.

По данным Reuters, сделка стоила почти четыре миллиарда долларов. Qualcomm заплатила эти деньги не за собственный аналог ChatGPT. Она купила попытку решить менее заметную проблему: новый чип бесполезен для большинства команд, пока привычные модели и инструменты на нём трудно запустить.

Modular собирает решение из трёх частей. На Mojo пишут быстрые операции для процессоров и ускорителей. MAX загружает и обслуживает модели. Modular Cloud продаёт тот же набор как облачную услугу. Вместе они должны дать разработчику один путь к оборудованию NVIDIA, AMD, Google, Amazon и Qualcomm.

На слайде все чипы равны. В работе — пока нет

В сводке анонсов Modular NVIDIA, AMD, AWS Trainium, Google TPU и ускорители Qualcomm стоят в одном списке. На сцене разница была заметнее. NVIDIA и AMD уже использовались для обслуживания запросов, а Trainium, TPU и Qualcomm показывали как новые переносы и следующие направления работы.

Поэтому фраза «тот же код работает везде» требует уточнения. Код может один раз запуститься в демонстрации, пройти набор тестов или месяцами работать под непредсказуемой нагрузкой. Это три разных уровня готовности. Последний требует оптимизации редких операций, наблюдения за ошибками и проверки стоимости на настоящих запросах.

На ModCon компилятор и инструменты Mojo открыли под лицензией Apache 2.0 с исключениями LLVM. При этом репозиторий Modular показывает, что MAX открывается по частям, а участие сообщества в разработке самого компилятора ещё оформляется. Открытый язык — важный шаг, но облако и вся платформа от этого не становятся автоматически независимыми от владельца.

Редакционная визуализация вычислительного стека от модели до энергоснабжения дата-центра
Модель — только начало цепочки. Дальше идут вычислители, память, сеть и физическая инфраструктура дата-центра.Иллюстрация: pommeDeTerre по материалам ModCon 2026

Один ответ модели — это две разные работы

Самое понятное техническое объяснение прозвучало в разборе Modular Cloud. Сначала модель читает весь запрос и разбирается в его контексте. На этом этапе ей особенно нужны вычислительные мощности. Затем она пишет ответ по одному фрагменту за раз. Здесь скорость чаще ограничивают память и постоянное чтение сохранённого контекста.

Если обе работы выполняет одна группа ускорителей, часть машин неизбежно ждёт. Modular предлагает разделить этапы: одни машины читают запросы, другие продолжают ответы, а контекст переезжает между ними. Количество машин в каждой группе можно менять отдельно.

Именно здесь обещание переносимости становится сложнее обычной компиляции. Нужно перенести не одну быструю операцию, а систему из многих машин — вместе с очередями, памятью, сетью и восстановлением после сбоев. Новый чип может отлично считать и всё равно проиграть, если данные слишком долго идут к нему и обратно.

Дешёвый ответ может дать дорогой результат

Artificial Analysis и SemiAnalysis предложили меньше смотреть на цену одного токена — небольшого фрагмента текста. В реальной работе модель не только пишет текст. Она ждёт результаты поиска, открывает страницы, запускает программы и иногда повторяет неудавшийся шаг. В такой задаче сама генерация может оказаться самой дешёвой частью.

Полезнее считать, сколько стоила законченная работа: обработанное обращение, принятое изменение в коде или готовый отчёт. В эту сумму входят запросы к модели, внешние инструменты, время ожидания, ошибки и ручные исправления. Более дорогая модель может в итоге обойтись дешевле, если она реже начинает заново.

Инвесторы на соседней панели пришли к похожему выводу со стороны денег. Капитал идёт уже не только в обучение моделей, но и в память, сети, электричество и специализированные ускорители. Открытые веса позволяют выбрать способ запуска, однако расходы на серверы и обслуживание никуда не исчезают.

Открытые веса не запускают себя сами

Google DeepMind, MiniMax, Reflection AI и Poolside обсуждали, как открытые веса помогают быстрее переносить модели на Apple Silicon, серверные ускорители и новые программные среды. Если лаборатория не успела поддержать нужное оборудование, это может сделать сообщество.

Но доступ к весам — ещё не готовая услуга. Сильную базовую модель дорого обучать, а после выпуска её нужно сжимать, ускорять, обновлять и проверять на каждом новом виде оборудования. Участники сравнивали обучение с фабрикой опытов: важно знать, на каких данных и с какой версией кода получен каждый результат.

Отдельно говорили о сбоях. Сервер может отключиться, агент — выбрать неверное действие, а длинная задача — оборваться посередине. Рабочая система должна это заметить, сохранить сделанное и понять, можно ли продолжить автоматически или пора позвать человека.

Для дата-центра важнее всего оказалось электричество

В разговоре Oracle Cloud и TensorWave главным ограничением назвали уже не количество чипов, а доступную электрическую мощность. Участники утверждали, что в некоторых странах Азии площадку можно подключить на месяцы раньше, чем в перегруженных районах Северной Америки. Это их оценка, а не общий срок для любого проекта.

Строительство всё чаще оплачивается заранее: клиент подписывает многолетний договор на вычисления, а поставщик на эти деньги готовит площадку. Пока спрос выше предложения, цену сохраняют даже ускорители прошлых поколений. Самый современный чип не помогает, если для него нет свободной стойки, охлаждения и энергии.

Поэтому выбор оборудования начинается не с рекордной характеристики. Сначала приходится выяснить, что реально можно подключить, как машины будут обмениваться данными и кто подготовит под них модель. Программная переносимость нужна именно потому, что идеального оборудования может не оказаться в нужном месте и в нужный срок.

MiniMax показала, зачем нужен весь этот запас

В последние полчаса MiniMax показывала генерацию видео из текста, изображений, исходных роликов и звука. Система могла учитывать первый и последний кадр, переносить движение и стиль, заменять объекты, сохранять лицо и синхронизировать губы с голосом.

Такое видео заметно тяжелее обычного текстового ответа. Оно требует больше памяти и вычислений, а изображение и звук должны совпасть во времени. Поэтому финальная демонстрация была хорошим примером нагрузки, ради которой Modular строит общий программный слой.

На сцене, конечно, показывали отобранные ролики. По ним нельзя судить, как часто система ошибается в длинных сценах, сколько длится генерация и сколько стоит удачный результат. Открытые веса позволяют провести свою проверку, но только на подходящем оборудовании и после отдельной настройки.

Следующая проверка будет не на сцене

После такой конференции легко начать сравнивать чипы. Полезнее сделать наоборот: взять одну знакомую рабочую задачу и выполнить её на двух видах оборудования, которые действительно доступны. Тогда сравниваются не обещания со сцены, а время, полная стоимость, ошибки и ручные исправления. Для российского проекта сразу добавятся вопросы оплаты, места хранения данных, поставки и поддержки — ModCon на них не отвечала.

Начать можно с открытой модели в доступном облаке, на арендованном сервере или на собственной машине. До запуска стоит включить подробные журналы, поставить предел расходов и ограничить права системы. А затем попробовать перенести модель и данные к другому поставщику. Если для этого снова приходится переписывать всё вокруг, обещанная свобода пока существует только на слайде.

Под «условиями MAX» скрывается важное отличие от Mojo. Из новой лицензии MAX убрали ограничения на выбор устройств, но сам MAX не стал полностью открытым продуктом. Его код можно изучать и изменять, однако свою изменённую версию разрешено распространять только в собранном виде. В приложение можно включать лишь те компоненты MAX, которые Modular прямо разрешила распространять. Если компания продаёт другим компаниям услугу по обучению или запуску моделей, она должна заранее согласовать с Modular использование знака Powered by Modular и показывать этот знак клиентам. Части MAX, уже выпущенные под Apache 2.0, остаются под этой открытой лицензией.

Поэтому автор независимого разбора ModCon для Forbes следит не за абстрактными «условиями», а за тем, насколько эта лицензия и будущий союз компаний дадут партнёрам реальную самостоятельность. Ещё два открытых вопроса — независимая проверка цифр производительности и повторяемость переноса на следующий чип. В этом и состоит главный риск для Modular. Qualcomm заплатила почти четыре миллиарда долларов за обещание ослабить зависимость от одного производителя оборудования. Теперь Modular должна доказать, что перейти на другой чип действительно проще, чем уйти с самой платформы Modular.