У Google DeepMind появилась база предсказаний последствий девяти миллиардов замен одной буквы в человеческой ДНК. OpenAI объявила о математическом результате, над которым одновременно работали десять тысяч агентов. А новый тест работы с настоящим кодом компаний оставил ведущие модели ниже 40% решённых задач. В сентябрьских новинках масштаб научных вычислений соседствует с очень конкретными действиями: изменить слово в готовой записи, перенести движения человека на робота или загрузить в память только нужные части языковой модели.
Marigold V2: глубина и устройство поверхности на обычном изображении
Marigold V2 представлен как модель, которая извлекает сведения о трёхмерной глубине и структуре из обычного изображения. На вход ей дают картинку, а на выходе получают несколько разных представлений: карту глубины, нормали поверхности, альбедо и другие карты. Нормали в объяснении автора означают ориентацию поверхности внутри изображения; альбедо он описывает как исходный цвет.
Главное отличие новой версии автор связывает с работой на уровне пикселей. В показанных сравнениях он обращает внимание не только на общую форму объектов, но и на детализацию, резкость и точность карт. В нескольких показанных сравнениях с другими моделями автор считает Marigold более подробной и дающей более высокое разрешение. Отдельно показаны сравнения оценки нормалей: их результат он описывает как более резкий и лучше соответствующий исходному изображению. По демонстрируемым тестам Marigold V2, по его словам, в среднем получает лучшие оценки среди сопоставимых моделей.
Код уже опубликован, а в репозитории на странице проекта есть инструкции по скачиванию и локальному запуску. В показанных режимах для изображения 1024 × 1024 требуется около 17 ГБ видеопамяти, для 2048 × 2048 — около 29 ГБ. Эти числа относятся к двум приведённым режимам обработки. Более подробная карта требует больше видеопамяти.
UniMate: движения для непохожих друг на друга скелетов
UniMate посвящена другой трёхмерной задаче — анимации персонажей с разным устройством скелета. Автор противопоставляет её моделям, которые специализируются на человеке и часто затрудняются при работе с птицами, змеями и другими необычными объектами. В демонстрации одна модель используется для цветов, Гарфилда, спутника и существа, похожего на дракона. Разнообразие примеров здесь существенно: речь идёт не только о нескольких человеческих персонажах разного роста, а о формах, которые очень мало похожи друг на друга. По оценке автора, модель хорошо справляется со всеми показанными анимациями.
Для генерации нужно передать уже подготовленную трёхмерную модель со скелетом и текстовую команду. Примеры команд — собака идёт вперёд и змея ползёт вперёд. По описанию автора, UniMate автоматически создаёт движение и не требует отдельного дообучения под каждый такой объект. По его оценке, показанные анимации делают UniMate одним из лучших вариантов для необычных персонажей и предметов. Помимо кода для локального запуска опубликован и код обучения; именно этим автор объясняет свою характеристику проекта как полностью открытого.
AlphaGenome Atlas: предсказания для миллиардов вариантов ДНК
Google DeepMind, по рассказу автора, выпустила AlphaGenome Atlas — большую карту человеческой ДНК, созданную с помощью ИИ. Объясняя масштаб задачи, он утверждает, что лучше всего изучены примерно 2% генома, в основном связанные с кодированием белков, а остальные 98% остаются гораздо менее понятными. Задача Atlas описана как предсказание последствий каждой возможной однобуквенной мутации. Таких вариантов насчитывается примерно девять миллиардов. Автор подчёркивает, что экспериментально проверить их все было бы практически невозможно: в данном случае речь идёт о предсказаниях AlphaGenome, а не о девяти миллиардах лабораторных экспериментов.
Получившийся набор данных, как сообщает автор, занимает один петабайт, содержит предсказания для более чем девяти миллиардов генетических вариантов и больше базы AlphaFold более чем в 30 раз. Его назначение объясняется через конкретную последовательность работы: исследователь ищет интересующую мутацию в готовом Atlas и получает прогноз её влияния, например на регуляцию генов или производство белков. Для такого обращения не нужно каждый раз запускать модель заново. Дополнительно представлен показатель, названный AVI: автор описывает его как оценку воздействия, которая помогает быстрее выделять варианты для дальнейшего изучения.
В качестве результатов использования автор приводит два случая. Исследователи, по его словам, обнаружили на 22% больше генетических ассоциаций в данных UK Biobank. Кроме того, Atlas помог поддержать решение ранее неразгаданного случая редкого заболевания. Автор видит основное изменение в том, что огромный объём прежде трудной для интерпретации генетической информации теперь оформлен в доступную для поиска базу. Atlas открыт для доступа: на странице предлагается выбрать Explore AlphaGenome Atlas и затем искать среди более чем девяти миллиардов мутаций.
LingBot-World 2.0: управляемый мир, который генерируется непрерывно
LingBot-World 2.0 представлен как интерактивная модель мира, работающая в реальном времени. Она непрерывно создаёт виртуальную среду, а пользователь управляет перемещением и прогулкой по ней клавишами. В показанных примерах автор отмечает более высокое качество по сравнению с предыдущими открытыми моделями мира: он считает окружение более детальным, связным и имеющим более высокое разрешение. Помимо клавиатурного управления предусмотрен ввод текстовых запросов, чтобы добавлять события или эффекты. Ещё одно дополнение — агентный механизм для NPC — персонажей, которыми не управляет пользователь: в среду можно включать других персонажей, которые двигаются и по-разному ведут себя или реагируют.
Команда проекта, как передаёт автор, заявляет о непрерывной генерации интерактивных миров более часа. Для системы реального времени названы разрешение 720p и скорость до 60 кадров в секунду. В основе используется видеогенератор Alibaba. По объяснению автора, мир создаётся отдельными порциями, благодаря чему результат можно передавать потоком в реальном времени. Предыдущая информация кешируется: это он описывает как своеобразную память о сцене.
Код и инструкции для скачивания и локального запуска опубликованы. Автор отдельно указывает две версии модели, у которых различаются приоритеты: более крупная имеет 14 миллиардов параметров и даёт более высокое качество, а версия на 1,3 миллиарда параметров работает значительно быстрее. Их различие описано именно как выбор между качеством большей модели и скоростью меньшей.
Isaac 0.5: восприятие, прогноз и действие в одной модели
Isaac 0.5 автор называет открытой базовой моделью для роботов, предназначенной для более общего понимания окружающего мира и выбора следующего действия. Перечень входов включает изображения, видео, языковые инструкции, текущее состояние робота и даже предыдущие действия. На основе этих сведений модель, по его описанию, может предсказывать следующее действие или отвечать на вопросы. Среди отдельно названных возможностей — поиск объектов, прогноз того, как мир может выглядеть дальше, и непосредственная генерация движений робота. Здесь понимание изображения представлено как часть более широкого набора задач.
В рассказе названы 36 миллиардов параметров. Обучающие данные собраны более чем с 35 робототехнических систем; автор связывает это с возможностью применения или переноса модели на разные типы роботов. Объём обучения он описывает как 100 тысяч часов робототехнического опыта и около миллиона часов общего видео. Особенность архитектурного подхода — совместное обучение пониманию видео, пространственному рассуждению, предсказанию будущих состояний и физическим действиям в одной общей основе. Автор объясняет замысел общего обучения так: знания, полученные при работе с видео и пространством, могут помогать роботу выбирать действия и понимать физический мир.
Модель уже открыта, и со страницы проекта можно перейти к инструкциям по скачиванию и запуску.
WorldSculpt: реконструкция с отдельными редактируемыми объектами
WorldSculpt получает несколько изображений сцены или видео и превращает их в полную трёхмерную сцену с отдельными объектами. Автор подчёркивает отличие от реконструкций, где результат может выглядеть как исходное окружение, но всё в нём слито вместе. В WorldSculpt каждый объект восстанавливается отдельно и одновременно правильно размещается внутри общего трёхмерного мира. Это позволяет дальше работать с ним как с самостоятельной частью сцены: передвигать, изменять размер и редактировать. Искомый результат здесь — не только похожая картинка, но и разделённое устройство самой реконструкции.
Дополнительно показан пример преобразования сцены Gaussian splats в сцену с трёхмерными сетками, описывающими форму объектов. Автор сообщает, что проект уже выпущен: код и инструкции по скачиванию и запуску находятся в репозитории, на который ведёт кнопка Code.
FIRE3D: геометрия и материалы для сцены, готовой к симуляции
FIRE3D также восстанавливает трёхмерную сцену с раздельными объектами из обычных фотографий или видео. Вход может состоять из одного изображения, нескольких изображений либо видеозаписи. Автор описывает весь результат как готовый к симуляции: каждый объект становится отдельной трёхмерной сеткой, описывающей его форму, с информацией о материале. Его можно передвинуть, дополнительно отредактировать или добавить в робототехническую симуляцию.
Для скорости автор приводит конкретные цифры: подготовка такой сцены занимает меньше минуты, а на одной видеокарте обрабатывается параллельно до 16 объектов. Эти показатели сообщаются в описании проекта. Код уже опубликован, в репозитории есть инструкции по локальной работе. Кроме того, выпущен код обучения. Автор отдельно отмечает это дополнение, поскольку доступен не только путь получения результата, но и обучение системы.
AuK: генерация, точечное редактирование и изменение звучания речи
Аудиомодель Tencent называется AuK и сравнивается автором с Nano Banana, но для речи. Сначала показана генерация голоса по тексту: можно описать желаемый голос и указать диалог. В примере звучит реплика о человеке, который всегда обещал вернуться и держал слово, но теперь не вернулся. Автор оценивает получившийся голос как печальный и наполненный горем. Следующая функция — клонирование голоса без дополнительного обучения: достаточно загрузить несколько секунд образца и затем заставить этот голос произнести другой текст. Для сравнения последовательно воспроизводятся исходный голос и сгенерированная речь.
Дальше демонстрируется редактирование уже существующего аудио, включая добавление и удаление слов. В первом коротком фрагменте человек произносит mamba out. Автор добавляет слово never и затем проигрывает изменённую версию. По его оценке, вставка соединяется с остальной речью без заметного разрыва. В другом примере удаляется целое предложение, после чего проигрывается оставшийся фрагмент. Автор снова подчёркивает естественность соединения после правки.
Более длинный пример содержит рассуждение о возрасте и переменах. В исходной версии говорящий затрагивает ответ на вопрос в свои двадцать лет, затем говорит, что изменения будут постоянными, и слышит реакцию на хороший вопрос. В редактировании между репликой о постоянстве изменений и следующей реакцией вставляется мысль о том, что самый важный урок — принимать перемены. Автор воспроизводит вариант до вставки и после неё и считает переход очень естественным. Этот пример показывает добавление целой фразы внутри разговора, а не только одиночного слова в коротком клипе.
Следующая группа возможностей относится к качеству и эмоциональной окраске записи. Модели дают шумный, неаккуратный клип, чтобы убрать шум или улучшить голос, затем показывают отдельное повышение разрешения и качества аудио. В обоих случаях вход и результат проигрываются последовательно. После этого одну существующую реплику о ежедневных приглашениях на светские мероприятия и о том, насколько это было приятно, сначала превращают в печальное произнесение, а затем в сердитое. В этой демонстрации меняется эмоция уже записанной речи, при этом сохраняется основное содержание одной и той же фразы.
Показано и изменение тембра: исходный мужской голос заменяется женским, описанным как ясный и яркий. Для этого проигрывается новостная фраза о преследовании детей на станции Flinders Street и штрафе 700 долларов; это материал аудиодемонстрации, а не отдельная новость обзора. Другой клип о восточном побережье преобразуется в шёпот. В перечне дополнительных операций названы добавление и удаление смеха и дыхания. Код доступен в GitHub с инструкциями по локальному запуску, а размер модели автор оценивает примерно в 6,12 ГБ. На этой основе он предполагает совместимость с большинством обычных пользовательских видеокарт и называет инструмент одним из самых гибких редакторов речи, которые видел.
DeepSeek-V4.1-Flash: новая архитектура и неоднозначное лидерство
В обзоре от 13 сентября обновление DeepSeek-V4.1-Flash автор считает гораздо более существенным, чем подсказывает изменение номера на 0,1: по его словам, устройство модели сильно отличается от предыдущей V4. Начинает он с результата 74,2 на DeepSWE 1.1. Этот балл, в его интерпретации, сделал бы Flash первой в таблице, выше GPT-6 Astra. Однако он сразу оговаривает, что команда DeepSWE ещё официально не добавила модель в рейтинг и её фактического размещения нужно дождаться. Затем автор называет результаты CyberGym и AutomationBench передовыми, отдельно утверждая, что в AutomationBench Flash превосходит GPT-6 Astra Max.
По приведённым характеристикам это смесь экспертов на 552 миллиарда параметров, но во время работы активны только примерно 8–16 миллиардов. Для объяснения автор использует образ команды экспертов, из которой в конкретной задаче задействуется лишь часть. Архитектура, по его словам, новая: в ней есть отдельные компоненты энкодера (обработки входных данных) и декодера (создания ответа), тогда как большинство современных языковых моделей он описывает как состоящие только из декодера. Автор отмечает и другие изменения в устройстве модели, но подробно останавливается на разделении входной обработки и создания ответа.
Дальнейшие сравнения дают менее однозначную картину, чем первое заявление о лидерстве. На LiveBench от Abacus AI автор помещает новую DeepSeek первой среди открытых моделей, на несколько пунктов ниже GPT-6 Astra и Claude Fable. В индексе VALS, оценивающем разные задачи интеллектуального труда, она тоже названа первой открытой моделью, чуть выше Kimi K3 и GLM 5.3. Но автор специально уточняет, что разница незначительна и эти участники фактически делят первое место. В приведённом индексе интеллектуальных способностей от Artificial Analysis DeepSeek, напротив, остаётся позади Kimi K3 и GLM 5.3.
При использовании через API названа скорость 217 выходных токенов — небольших фрагментов текста — в секунду: автор сравнивает её с более чем трёхкратным преимуществом над GLM и примерно семикратным над Kimi K3. Стоимость он описывает как значительно меньшую, чем у других ведущих открытых моделей и закрытых GPT-6 и Fable, но конкретных тарифов не приводит. Модель открыта, хотя исходная загрузка занимает около 510 ГБ. Сообщество уже выпустило изменённые и квантованные варианты: самый маленький показанный GGUF Q1 занимает 106 ГБ. Для тех, у кого нет оборудования под локальный запуск, автор указывает API как доступный путь использования и оценивает DeepSeek как наиболее выгодную по стоимости ведущую модель.
OpenAI и уравнения Навье — Стокса: результат с внешней силой
OpenAI объявила о результате для уравнений Навье — Стокса. Автор объясняет исходный вопрос на примерах обычного движения воды и воздуха. Эти уравнения описывают движение жидкостей и газов — от воды, закручивающейся в чашке, до воздуха в комнате. Вопрос в том, существуют ли условия, при которых такое описание перестаёт работать. Автор связывает его с задачами тысячелетия и говорит примерно о 90 годах без решения. По его изложению, OpenAI использовала внутреннюю модель, которую сама компания считает значительно более способной, чем GPT-6 Astra.
Предложенный результат автор объясняет через водоворот при очень специальных условиях. Вихрь продолжает растягиваться, а скорость неограниченно растёт за конечное время. Он называет такое поведение сингулярностью или blow-up и интерпретирует его как свидетельство возможного нарушения привычного описания при определённых условиях. Для работы, по его словам, использовались десять тысяч одновременно действующих агентов на протяжении 88 часов. На показанном сравнении внутренняя модель лучше решает открытые математические задачи. Автор сопоставляет эти 88 часов с названными десятилетиями работы людей и оценивает сообщение как крупный математический прорыв.
После этого автор вводит существенные оговорки и разделяет версии задачи. Более простой уровень он связывает с уравнениями Эйлера, где убрана вязкость. Вязкость поясняется как густота жидкости: мёд более вязкий, чем вода. Ещё одно различие — наличие внешней силы. Пример такой силы — перемешивание воды: оно направляет происходящее и помогает добиться нужных условий. Примерно тогда же, по рассказу автора, математики, один из которых связан с Anthropic, решили более простой вариант уравнений Эйлера с внешней силой.
В объявленном результате OpenAI внешняя сила присутствует, но вязкость жидкости сохраняется. Поэтому в его объяснении это более трудный результат, чем пример без вязкости. Но он прямо говорит, что задача без внешней силы всё ещё не решена. Остаётся вопрос, может ли вода или газ самостоятельно прийти к сингулярности, когда никто не перемешивает жидкость и не направляет её в нужный вихрь. Задача Навье — Стокса без внешней силы остаётся открытой. Автор всё равно сохраняет оценку события как важного прорыва и ожидает дальнейшего ускорения таких достижений.
Show-Harness: зрительная модель выбирает действия робота
Show-Harness исследует вопрос, можно ли управлять роботом при помощи обычной модели, понимающей изображения. В описанном подходе существующей модели, понимающей изображения и текст, дают список понятных движений: переместиться влево, повернуться, пойти вперёд или что-то переместить. Она смотрит на сцену, рассуждает о следующем шаге и выбирает действие из этого набора. Автор подчёркивает границу: сама по себе это зрительно-языковая модель, а не модель непосредственного управления роботом. Поэтому выбранные команды проходят через интерпретатор действий, специфичный для робота, который переводит их в реальные движения.
По сообщению автора, такая схема работает, а успешность может достигать 100%, если модель получает осмысленные названия действий. Далее подход оформляется в программную оболочку, куда можно подключить разные зрительно-языковые модели — Gemini, GPT и открытые варианты, названные Qwen или GLM. GitHub-репозиторий с инструкциями уже опубликован. Отдельно оговорено условие применения: для этой схемы нужен настоящий робот, а наличие одной модели и кода не заменяет робототехническое оборудование.
Edge0: загрузка только необходимых экспертов
Edge0 представлен как способ запускать большие языковые модели на устройствах, которым не хватает памяти для полного набора параметров модели. Он рассчитан на смесь экспертов и объясняется на модели, названной Qwen 3.5 35B. Автор сравнивает такую структуру с командой специалистов: запрос направляется только к нужным экспертам, например математический вопрос — к соответствующему специалисту. По его словам, у этой модели во время работы активны лишь три миллиарда параметров из 35 миллиардов. Но обычный запуск всё равно требует разместить в памяти полную модель. Edge0 вместо этого подгружает только экспертов, необходимых для текущего вопроса, связывая потребление памяти прежде всего с активной частью.
Дополнительно модель сжата до Int4 — формата с более компактным хранением чисел. Автор признаёт возможность потери качества при сжатии и сообщает о Recover-LoRA, который должен вернуть значительную часть потерянного качества. В показанной таблице для версии с 35 миллиардами параметров пиковый активный расход памяти равен 2,9 ГиБ (около 3,1 ГБ), для меньшей версии на восемь миллиардов — 1 ГиБ (около 1,1 ГБ). Обе проверяли на Mac mini M4 Pro с 24 ГБ памяти при коротком контексте; числа описывают активный расход модели, а не всю память компьютера. Меньшая версия основана на Ling 3.0 Tiny от Inclusion AI. В итоге механизм сочетает выборочную подгрузку, сжатие и восстановление качества. На странице есть инструкции по скачиванию и запуску на Mac.
Real-SWE: требования компании сложнее написания кода
Real-SWE автор противопоставляет программным тестам, названным SWE-bench и DeepSWE, которые, по его оценке, быстро насыщаются: модели уже решают большую долю заданий. Новый тест проверяет работу с реальным программным обеспечением компаний: агент получает доступ к закрытому коду и должен выполнить изменение, важное для бизнеса. Среди примеров — исправление расчёта налогов в счетах и миграция клиентских аккаунтов. Сложность автор видит в понимании устройства конкретного продукта и правил, распределённых между разными системами. Частая неудача — пропустить требование. Поэтому написать код недостаточно: нужно выяснить всё, что должно измениться, и правильно соединить результат с существующим продуктом.
Результаты в этой постановке остаются ниже 40% даже у Fable и GPT-6. В таблице, приведённой 13 сентября, Fable 5.1 занимает первую строку с 38,8%, GPT-6 Astra — вторую с 33,8%, Gemini 3.8 Flash — третью, а лучшая открытая модель GLM 5.3 — четвёртую. Проценты для двух последних автор не озвучивает. Он также предупреждает, что значимого различия между всеми четырьмя нет: статистически они фактически делят первое место.
Suno V6: генерация песни и правки отдельных её частей
Suno V6, по описанию автора, расширяет контроль и над созданием песни с нуля, и над её последующим точечным редактированием. Источником новой музыки может быть текстовый запрос или аудиообразец. Но главным в этом эпизоде названы конкретные изменения по инструкции: заменить одну строку текста, не затрагивая остальную песню; соединить вокал из одной композиции с инструментом из другой; выделить гитарный рифф и построить на его основе бит. Затем воспроизводится музыкальная демонстрация.
Автор разделяет три выпущенных варианта. Обычная V6 доступна в платных тарифах и рассчитана на надёжные, точные результаты. V6 wild также относится к платным планам, но описана как менее предсказуемая и более вариативная, подходящая для неожиданных идей. V6 mini открыта всем, включая бесплатный тариф: она значительно быстрее, однако уступает V6 по качеству и точности. После этого автор напоминает о закрытости и платном характере Suno и говорит о появившихся ограничениях, в том числе на скачивания.
YuE2: сначала музыкальный план, затем готовая песня
Следующий открытый музыкальный генератор — YuE2. Его особенность автор объясняет через промежуточный музыкальный план. Модель не переходит прямо от текстового запроса к финальному звуку, а сначала составляет нечто ближе к партитуре: в этом представлении есть мелодия, ритм, аккорды и структура. План можно дополнительно редактировать, после чего модель превращает его в полноценную песню с вокалом и сопровождением. Автор говорит о потенциальной возможности менять мелодию, слова, темп и аранжировку на структурированном музыкальном уровне, вместо того чтобы только уточнять запросы и надеяться на нужный результат.
Для знакомства с результатом звучат несколько музыкальных примеров. В одном английский вокал обращается к Джону, говорит о ритме, буги-вуги и желании танцевать. Другой содержит мотивы ночи всех святых, посещения соседей, памяти об ушедших, сладостей и сочетания радости с печалью. Эти примеры демонстрируют готовые песни с вокалом. Отдельно названа возможность делать каверы: в качестве конкретного примера Jingle Bells передают модели, чтобы заново исполнить мелодию в минорной тональности.
По показанным тестам разработчики, как передаёт автор, считают YuE2 лучшей открытой моделью, выше Minimax Music 3 и ACE-Step 1.5, и даже заявляют более высокое качество песен, чем у Suno V6. На странице уже доступны материалы проекта и GitHub с инструкциями по скачиванию и локальному запуску. Размер модели автор называет равным 7,3 ГБ и на этой основе предполагает, что она сможет работать на большинстве потребительских видеокарт.
ChatGPT for Financial Services: данные, расчёты и проверяемые источники
ChatGPT for Financial Services описан как сочетание GPT-6 Astra с финансовыми наборами данных и инструментами для банковских исследований. Автор перечисляет исследование компаний, построение финансовых моделей и оформление результатов в таблицы, документы или презентации. Среди поставщиков данных названы PitchBook и CrunchBase. Важная отдельная возможность — проследить числовой показатель до конкретной таблицы или текстового фрагмента, чтобы аналитик мог проверить, откуда он взялся. Компании также могут передавать собственные шаблоны, и результат должен следовать их привычному формату.
Автор предполагает, что такие функции могут автоматизировать значительный объём финансовой работы, но это его оценка возможного применения. Он сразу оговаривает ограничение доступа: продукт пока не доступен всем. Для запроса доступа нужно обратиться к отделу продаж через страницу.
UMR: перенос человеческого движения с учётом тела робота
UMR расшифровывается как Unified Motion Retargeting и переносит движения человека в движения, на которых может учиться гуманоидный робот. Автор объясняет, почему прямое копирование неудобно: у человека и робота различаются пропорции, суставы и допустимые пределы движения. UMR представляет поверхности обоих тел как наборы трёхмерных точек, а затем обучается соответствиям между ними. В его пояснении это сопоставление формы человеческой позы с телом робота при соблюдении ограничений последнего.
По описанию автора, подход помогает сохранять контакты с предметами и окружением. Простые примеры — взять мяч или сесть на стул. Среди более сложных движений перечислены удары ногой с разворотом, подъём по лестнице и игра в теннис. Автор видит результат в повторном использовании человеческих данных о движении на разных роботах без ручного переустройства каждого движения. Код уже опубликован, а в репозитории есть инструкции по локальной настройке.
Unitree UnifoLM-WLA: действия рук и координация всего тела
Открытая модель Unitree названа UnifoLM-WLA и содержит шесть миллиардов параметров. На вход она получает то, что видит робот, инструкцию и сведения о текущем состоянии, а затем выдаёт действия. По рассказу автора, одна модель покрывает 64 задачи: 54 относятся к работе за столом, ещё десять — к координации всего тела. Поддерживаются двухпальцевые захваты и разные пятипальцевые робототехнические кисти, поэтому набор не привязан только к одному типу рабочего органа. Автор подчёркивает сочетание широкого перечня заданий с небольшим, в его оценке, размером модели.
Ключевая идея обучения — предсказывать, какие части сцены изменятся в ходе взаимодействия. В качестве примера автор объясняет складывание полотенца: робот должен заранее учитывать относящееся к задаче движение в сцене. Этот прогноз связан с компонентом, генерирующим следующие действия робота.
Демонстрации включают загрузку белья в стиральную машину. В другой последовательности робот берёт бутылку и выбрасывает её, затем достаёт мусорный пакет, идёт к мусорному контейнеру и выбрасывает туда мусор. Автор отдельно указывает, что здесь требуется координация всего тела. Ещё один пример сочетает манипуляции с предметами и перемещение по кухне. Опубликованы модели и обучающий набор данных. При выборе Models доступна загрузка модели; её размер меньше девяти гигабайт. Он предполагает, что это позволит разместить модель непосредственно в роботе для локальной автономной работы.
MiniCPM5-2B: небольшая модель и её обучающие данные
Ещё одна новая модель — MiniCPM5-2B от OpenBMB. Автор вводит её как маленькую модель для автономной работы на периферийных устройствах. У неё два миллиарда параметров. В показанных тестах перечислены рассуждение о коде, математика, выполнение инструкций и общие знания. Автор считает модель передовой среди вариантов сопоставимого размера и утверждает, что в среднем она превосходит даже Qwen 3.5 4B и другие небольшие модели.
Вместе с моделью выпускается качественный обучающий набор данных, лежащий в основе её подготовки. Автор отмечает, что его можно получить отдельно для обучения собственной маленькой модели. На странице Hugging Face размер самой MiniCPM указан в рассказе как примерно пять гигабайт. Автор предполагает, что такой объём позволит разместить её на большинстве потребительских устройств.



