За неделю развивались сразу несколько направлений. Qwen получила модели для длинного аудиовизуального контекста и синхронного перевода, Google — новые голосовые модели и метод улучшения стратегии поиска без изменения весов, а Jev — быстрый интерфейс для решений из заранее заданного списка. Одновременно открылись проекты для локального распознавания речи, программирования, математического поиска, сжатия больших моделей и управления роботами.

Для читателя различия практичнее общего ярлыка «новый ИИ». Одни системы уже опубликованы вместе с весами и инструкциями, другие доступны только через API или лист ожидания, третьи остаются исследовательскими демонстрациями. Размеры варьируются от 9 МБ до десятков гигабайт, а заявленные тесты нельзя переносить на рабочую нагрузку без собственной проверки. Ниже сохранены все 22 темы недели, показанные примеры, числа и ограничения.

Новая камера, потоковая речь и мир с памятью

Система Meridian от Viggle принимает готовую видеозапись, оценивает геометрию сцены и строит её приблизительное трёхмерное представление. После этого пользователь задаёт новую траекторию камеры, а система заново генерирует ролик с выбранной точки обзора. В демонстрациях камера обходит объект, движется в нескольких направлениях, меняет дистанцию и останавливает происходящее для эффекта застывшего времени.

Глубину и положение камеры оценивает VGGT-Omega: результатом становится трёхмерное облако точек. Meridian сначала быстро создаёт грубый кадр из новой позиции, затем MiniMax-H3 превращает эту основу в полноценное видео. Такая последовательность разделяет пространственный расчёт и финальный синтез изображения, поэтому траекторию можно контролировать подробнее, чем одним текстовым запросом к видеогенератору. Карточка проекта указывает выходные ролики длительностью 3–10 секунд и видеокарту с большим объёмом памяти. Примерно 62 ГБ занимает базовый артефакт MiniMax-H3, тогда как каждый из двух адаптеров Meridian LoRA — около 2,5 ГиБ.

Код Meridian опубликован под Apache 2.0, но всё сочетание нельзя без оговорок называть полностью открытым: веса наследуют лицензию сообщества MiniMax-H3, а VGGT-Omega распространяется по некоммерческой лицензии FAIR. Более компактные квантованные варианты пока остаются ожиданием: проект не объявлял их готовым продуктом.

Открытая модель R2T2 решает другую задачу: возвращает распознанный текст непрерывно по мере поступления звука. Это отличается от обработки завершённого файла, когда системе доступна вся запись. В сравнительной демонстрации R2T2 и GPT Live Transcribe дали совпавший текст, а показанный график ошибки и задержки поместил варианты R2T2 в предпочтительную нижнюю левую область.

Название R2T2 раскрывается как Real Real-Time Transcription. Модель основана на Qwen3-ASR-1.7B, принимает фрагменты длительностью от 80 мс до 2 секунд и, по данным проекта, даёт среднюю задержку примерно 200–600 мс; основная оптимизация выполнена для английского и китайского. Утверждения о самом низком уровне ошибок и задержке и о полном совпадении с GPT Live относятся к демонстрации и тестам разработчиков, а не к независимой проверке на произвольной записи. Упомянутые 57 языков относятся к промоматериалу GPT, а не к R2T2.

R2T2 опубликована с инструкциями для локального запуска. Приблизительно 4 ГБ — правдоподобная оценка несжатых весов модели на 1,7 млрд параметров, но проверенная страница проекта не указывает этот объём как спецификацию. Утверждение о совместимости с большинством потребительских видеокарт также требует проверки с учётом формата весов, памяти и требуемой скорости потока.

Исследовательская система Jing и DAO от X-Gen Labs разделяет генерацию изображения и состояние виртуальной среды. DAO хранит общее состояние, применяет правила, обновляет его после действий и продолжает учитывать автономных агентов, даже когда конкретная область не находится в кадре. Jing получает это состояние и генерирует то, что должен видеть отдельный персонаж от первого лица.

Разделение нужно для устойчивости мира. Если персонаж покинул область и вернулся, предметы, другие персонажи и сделанные изменения должны остаться согласованными. Рядом с демонстрацией были заявлены отсутствие заранее заданного ограничения по длительности, превосходство над Veo 3 и Genie 3 и уникальность отдельного управления состоянием, но страница XGEN этого не устанавливает. Наоборот, разработчики предупреждают, что длинные сессии могут постепенно терять согласованность, а для работы в реальном времени ещё нужны меньшая задержка, лучшая точность и надёжность.

Одна демонстрация показывает трёх персонажей в общей среде, каждый со своей точкой зрения; происходящее между этими представлениями остаётся согласованным. Пока это исследовательская предварительная версия. Для показа указаны опубликованный код JING, полная дообученная MiniMax-H3 примерно на 67 ГБ и возможные будущие квантованные варианты. Страница XGEN не подтверждает ни этот размер, ни наличие готового квантованного выпуска, поэтому эти детали нельзя считать спецификацией проекта.

Google: стратегия поиска и разговор во время работы инструментов

DreamRSI расшифровывается разработчиками как Recursive Self-Improvement Through Evolving Worlds, но не меняет ни веса, ни архитектуру базовой модели. Агент сохраняет полную историю поиска решений в дереве: какие ветви были испробованы, где возникли неудачи и какие результаты дали успешные попытки. Затем он может повторно анализировать тысячи таких деревьев без повторного выполнения прежних поисков.

По сохранённым данным система генерирует улучшенные стратегии обхода, проверяет их на прежних записях и применяет наиболее результативные. Новый поиск создаёт следующую историю для очередного цикла. Таким образом, улучшается порядок исследования вариантов, распределение вычислений и решение о том, какие ветви продолжать, хотя сама модель остаётся неизменной.

В представленных тестах математической оптимизации Dream-RSI показывает сильные, но неодинаковые результаты: SimpleTES лучше на autocorrelation, Dream-RSI немного лидирует на Sum Difference и делит первое место в Circle Packing. В задачах GPU-ядер она сократила число генераций в 2,43 раза для VGG16 и в 1,79 раза для LayerNorm; «более чем вдвое» относится только к VGG16. На ConvDiv и ConvMax производительность выросла соответственно в 2,09 и 1,44 раза. По сравнению с фиксированной политикой понадобилось в 1,7 раза меньше вызовов discovery-агента, а на Lasso — до 162 раз меньше, чем SimpleTES. Техническая работа опубликована на странице проекта, хотя во время проверки ссылка arXiv там оставалась заглушкой. Формулировка о «самопереписывании Gemini» неверна: меняется код стратегии исследования, а параметры и устройство базового агента остаются фиксированными.

Голосовое семейство Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking разделено по режиму работы. Базовая версия представлена как более быстрая и дешёвая для массовых разговорных сценариев, Extended Thinking — как более мощная для многошаговых рассуждений. Обе принимают потоковый звук, изображения и видео и могут параллельно вызывать инструменты, включая веб-поиск.

Практическая особенность — модель способна продолжать говорить, пока в фоне выполняется вызов инструмента или API, а затем включить результат в тот же разговор. Google также заявляет автоматическое распознавание и переключение между 97 языками и работу с живым изображением камеры почти в реальном времени. Для Extended Thinking компания приводит 82,6 балла в Artificial Analysis speech-to-speech, 68,6% в tau-Voice, 35,1% в tau-Voice Banking и 97,7% в Big Bench Audio. В показанном сравнении качество названо сходным с GPT Live, Astra и Grok Voice, а базовая Gemini 3.8 Live — во много раз дешевле Grok Voice и GPT Live. Все показатели и ценовой график взяты из материалов Google или показанного сравнения; фактическая стоимость зависит от длительности, модальностей и числа вызовов инструментов.

Доступность двух версий разделена. Базовая Gemini 3.8 Live появилась в Gemini API и AI Studio, закрытой предварительной версии для компаний и Search Live. Extended Thinking имеет собственный доступ через API, AI Studio и закрытый корпоративный показ, а также развёртывается в Gemini Live и выбранных продуктах Workspace. Упоминание нескольких продуктов не означает, что обе версии одновременно доступны каждому пользователю во всех регионах и интерфейсах.

Qwen понимает длинное видео и переводит живой разговор

Alibaba представила Qwen 3.8 Omni Flash — мультимодальную модель, принимающую текст, звук, изображения и видео. В демонстрациях она выделяет фрагменты ролика и готовит расшифровку, отвечает в реальном времени на вопросы о сцене с камеры, а также разбирает загруженное видео по персонажам, движению камеры, композиции, диалогу и звуку.

Заявленное окно контекста — один миллион токенов. Официально подтверждённый ориентир для аудиовизуального ввода составляет до часа видео; пересчёт этой цифры в «более десяти часов аудио» не подтверждён как спецификация. Большое окно само по себе также не доказывает, что модель одинаково точно удерживает каждую деталь по всей длине записи.

В собственных таблицах Qwen сообщает более чем о 25% среднего прироста относительно Qwen3.5-Omni-Plus по 29 тестам. Формулировка производителя точнее широкого тезиса о победе над Gemini: аудиовизуальные результаты названы близкими к Gemini, а совокупные аудиопоказатели — более высокими. Стоимость аудиовхода через API, по данным Qwen, снижена более чем на 98%, аудиовизуального — более чем на 93%. Доступ предоставляется через Qianwen AI Platform и API; открыты Qwen-Live Harness и Video2Note, но веса самой модели не опубликованы, а их возможный будущий выпуск остаётся предположением.

Qwen 3.8 Live Translate работает как синхронный переводчик: принимает живой звук или видео, выдаёт перевод во время речи, формирует текст и разделяет участников, помечая их реплики. Также заявлена генерация переведённой речи с сохранением голоса говорящего. В демонстрации система обрабатывает разговор двух собеседников о дожде и правильно разделяет их фразы.

Изображение или видеоряд можно добавить как контекст для перевода. Заявлены 60 языков речевого ввода, текстовый вывод на 60 языках и звуковой вывод на 29. По данным Qwen, показатель LAAL снизился с 2,8 до 2,3 секунды. Победы над Seed Live Interpret, GPT Realtime и Gemini Live по верности, беглости, краткости, качеству и задержке остаются тестами разработчиков. Их нужно проверять на нужной паре языков, шуме, перебиваниях и профессиональной терминологии. Доступны API и онлайн-демонстрация.

От 9 МБ на устройстве до кластера из 100 000 ускорителей

Needle 3 рассчитана на телефоны, часы и микроконтроллеры. В зависимости от варианта бинарные файлы CQ2 занимают от 9 до 29 МБ, а полная конфигурация содержит от 29 до 121 миллиона параметров. Архитектура основана на Laddered Simple Attention Network, а не на обычном трансформере. Один набор весов поддерживает несколько режимов: устройство активирует от двух до двадцати слоёв в зависимости от доступных ресурсов.

Разработчики описывают эту настройку глубины как intelligence laddering. По их тестам Needle 3 превосходит в десять раз более крупные модели в мобильных задачах вызова инструментов и сравнима с моделями в два-три раза крупнее в извлечении данных. Настроенная подсеть из четырёх слоёв и 29 млн параметров обошла DeepSeek V4 Flash в показанной прикладной задаче, но облачная и локальные системы запускались в разных условиях. Это не универсальная модель передового уровня: целевые действия проще и заранее ограничены — включить или выключить свет, выбрать команду для небольшого робота, смартфона, носимого устройства или очков дополненной реальности. Опубликованы инструкции и список поддерживаемых устройств и операционных систем.

На другом конце масштаба Z.ai описала, как агент на базе GLM-5.3 помог подготовить инфраструктуру для GLM-5.3 Flash. Развёртывание проводилось на кластере более чем из 100 000 ускорителей китайского производства. Предположение, что это были устройства Huawei, не подтверждено самим описанием и остаётся догадкой. Новая архитектура поддерживает мультимодальность и контекст примерно в миллион токенов.

Инфраструктурный агент получал код и подробную обратную связь: точные журналы, трассировки, результаты тестов и профилирования, место потери времени, ошибочный расчёт и условия, при которых изменение помогало или вредило. Затем он многократно формулировал гипотезу, менял код, запускал проверку и выбирал следующий шаг. Это важная часть результата: общая фраза «стало медленнее» не дала бы системе тех же данных для локализации проблемы.

В одном случае агент связал усиливавшуюся на очень длинном контексте ошибку с вычислениями пониженной точности внутри ядра и помог исправить её. В другом ядро декодирования ускорили в 1,71 раза. Z.ai также заявляет трёхкратный рост сквозной пропускной способности и развёртывание менее чем за две недели. Процесс не был автономным: инженеры задавали цели, строили испытательную среду, определяли границы безопасности и обеспечивали подробную обратную связь. Компания предполагает повторно использовать этот цикл для будущих систем, но не заявляет автономного рекурсивного самоулучшения.

Xiaomi выбрала необычный для крупной лаборатории формат и показывает обучение с подкреплением MiMo V2.6 до его завершения. На панели в реальном времени видны стоимость, объём данных, размер пакета, развёртывания и изменения результатов тестов. Это наблюдение за процессом, а не объявление законченной модели.

На снимке панели от 20 сентября стоимость превысила 1,6 млн долларов, текущий шаг показывал почти 3 млрд токенов, а Pro-модель — почти 48 млрд токенов накопленным итогом. DeepSWE вырос приблизительно с 58 до 67, Automation Bench также улучшался. Позднее счётчики уже показывали около 2,47 млн долларов, 3,42 млрд токенов текущего шага, 71,57 млрд накопленных токенов и 72,57 у Pro в DeepSWE. Это подтверждает живой характер панели и одновременно не позволяет выдавать старый снимок за текущий итог. Запросы обучения распределены по программированию, общим задачам, кибербезопасности и другим категориям.

Робот учится по примеру, а агент восстанавливает ключ Enigma

Фреймворк GPT Policy для In-Context Robot Learning позволяет роботу попытаться освоить задачу по демонстрации без переобучения самой робототехнической модели. Контекстом может быть видео действий человека или другого робота, изображение желаемого результата либо сведения о прежних неудачах. Универсальная визуально-языковая модель со зрением обрабатывает эти данные, после чего фреймворк управляет новой попыткой.

В натурных испытаниях робот без демонстрации не смог поднять красное полотенце и блокнот — 0 из 3 попыток для каждой задачи. После просмотра человеческого примера результат вырос до 2 из 3. Для отвинчивания крышки использовалось видео робота, а не человека: оно дало 2 успеха из 3, а видео вместе с согласованными действиями робота — 3 из 3. В задачах с изображением желаемого результата робот также справился с 3 попытками из 3. Команда проекта прямо предупреждает, что эти небольшие опыты не позволяют надёжно ранжировать модели. Изменились входные сведения во время выполнения, а не веса; код фреймворка и инструкции опубликованы.

В отдельном расследовании GPT-6 Astra помогла восстановить немецкое сообщение Enigma 1941 года длиной 82 символа. Система искала материалы в исторических архивах, сравнивала варианты чтения нечётких букв, использовала связанные сообщения, написала симулятор Enigma и программно перебирала настройки машины.

Проект шёл 14–15 сентября, около двух дней; журналы не позволяют восстановить точное число часов человека и модели. В поиск был жёстко включён 14-буквенный фрагмент ROSENOWROSENOW, после чего восстановили остальные 68 букв. Команда перебрала 4,29 млрд комбинаций в 43 016 пакетах, получила 97 337 кандидатов и проверила результат обратным шифрованием. Расшифрованный текст оказался служебным: отправитель сообщал местонахождение, просил указать дальнейший маршрут и требовал немедленного ответа по радио.

Предметом проекта было одно сообщение 1941 года. Страница проекта не устанавливает независимо глобальное утверждение, что именно этот текст никто не расшифровывал 80–85 лет. Человек выбрал цель, предоставил важные сведения и направлял работу; Astra выполнила значительную часть поиска, программирования и параллельных опытов.

Jev, Laya и Nimble: быстрый выбор из заданных ответов

Jev относится к моделям System 1 и предназначена для быстрого выбора среди заранее заданных вариантов. Пользователь передаёт запрос и полный список допустимых ответов, а модель возвращает вероятность или уровень уверенности для каждого. В примере с маршрутизацией письма вариантами служат отделы компании; письмо направляется туда, где оценка выше всего. Заявленная задержка составляет примерно 70–500 миллисекунд, причём один вызов может параллельно отвечать на несколько вопросов об одних данных.

Метод обучения с подкреплением для калиброванных решений нацелен на согласование вероятностей с фактической точностью. Если модель присваивает классу 80%, среди большого числа таких решений правильными должны оказаться примерно 80%. Тогда ответы выше выбранного порога, например 95%, можно обрабатывать автоматически, а остальные передавать человеку или более мощной модели. Это заявленная цель обучения; реальную калибровку нужно измерять на данных конкретной организации.

Jev не предназначена для эссе или глубокого исследования. Она принимает структурированный набор действий; в другой демонстрации таким набором стали команды для игры Doom. TypeSafe заявляет цену $0,042 за миллион входных токенов и бесплатный выход. По внутренней оценке точность сопоставима с передовыми моделями при меньшей стоимости, но судья основан на GPT-6 Astra и Fable 5.1, что сама компания признаёт источником смещения. Указанные 0% галлюцинаций не являются эмпирическим результатом: они означают гарантированное соответствие схеме, поскольку модель не выдаёт свободный ответ вне допустимого списка. Выбранный класс и его вероятность всё равно могут быть ошибочными. Jev закрыта, доступна через API и на момент выпуска требует записи в лист ожидания.

Открытая Laya использует похожий интерфейс: получает список ответов и возвращает оценки уверенности. Создатель проекта утверждает, что работал над концепцией раньше Jev и опубликовал вторую работу в сентябре предыдущего года. Это спорное заявление о приоритете, а не независимо установленная история происхождения Jev.

В собственных тестах Laya немного превосходит Jev: для одиночного запроса указано 32,8 мс, а для одного вопроса в пакетном режиме — 7,2 мс. Токенизатор охватывает более 100 языков, но в опубликованном тесте порог втрое выше случайного результата прошли 45 из 51 проверенного языка; лучший показатель 0,766 получен после дообучения, тогда как базовый находится примерно на уровне 0,35. Выпущены базовая, многоязычная и увеличенная по контексту версии; отдельно приводится размер основной модели 2,37 ГБ. Веса доступны под Apache 2.0, опубликованы инструкции локального запуска и сценарий дообучения на своих данных.

Ещё одна открытая реализация — Bespoke Nimble. Эта реализация воспроизводит принцип структурированного выбора: текст и набор вариантов поступают на вход, а система возвращает уверенность для каждого ответа. Основой служит Qwen 3.5 9B, к которой добавлен LoRA-адаптер для решений по заданной схеме.

В показанных результатах качество близко к Jev, но это аналогичный интерфейс, а не эквивалентная реализация. Карточка модели указывает предел запроса 2048 токенов и не более 26 вариантов ответа. Базовую Qwen нужно загрузить отдельно; примерно 20 ГБ — правдоподобная оценка BF16, но не спецификация карточки. Текущий размер адаптера указан как около 165 МиБ, а не 193 МБ. Оценка, что сочетание поместится на видеокарте среднего или высокого класса, зависит от формата весов и памяти. Инструкции локального запуска опубликованы, лицензия — Apache 2.0.

Юридический поиск, цепочка уязвимостей и оболочка для кода

OpenAI Astra for Law — специализированная конфигурация GPT-6 Astra для профессиональной юридической работы. Вместо общего веб-поиска она использует отдельный индекс более чем из 230 млн URL с судебной практикой США, нормативными актами, правилами судов и административными решениями; индекс обновляется ежедневно и через CourtListener охватывает, по заявлению OpenAI, более 99,9% опубликованных прецедентных решений США. По фактам дела система должна находить релевантные источники, представлять позиции сторон, анализировать доказательства, готовить юридические тексты и оценивать влияние договорной оговорки на риск сделки.

На частном тесте Vals из 200 вопросов OpenAI сообщает 54,0% правильных ответов против 38,7% у базовой Astra с веб-поиском — относительный прирост 40%. Это оценка OpenAI/Vals без открытого независимого воспроизведения. Первоначальный доступ ограничен выбранными фирмами через Trusted Access, доступ к API обещан позднее. Режим без хранения данных доступен только подходящим клиентам API; для Enterprise действуют отдельные правила, по которым данные по умолчанию исключены из ручной проверки. Специальный индекс и интеграции не отменяют проверки юристом: актуальность юрисдикции, полнота источников и применение нормы к фактам остаются отдельными вопросами.

Следующая история известна только из собственного отчёта исследователей Hacktron. Трое специалистов утверждают, что менее чем за 72 часа построили цепочку проникновения во внутренние системы OpenAI, используя Claude от Anthropic как вспомогательный инструмент. Начальной точкой был форум сообщества OpenAI, где они нашли уязвимость обработки изображений в библиотеке libheif.

По их описанию, специально подготовленный HEIF-файл проходил через связку libheif, ImageMagick и Discourse, вызывал переполнение кучи и после анализа отсутствовавшего переноса исправления в Debian позволял удалённо выполнить код на сервере форума. Это была полноценная эксплуатация памяти, а не просто необычная картинка, и сама по себе она ещё не открывала важнейшие системы. Вторым элементом стала ошибка в едином входе OpenAI. Hacktron заявляет, что сочетание дефектов позволяло захватывать учётные записи ChatGPT и Codex вошедших на форум людей, в том числе сотрудников.

Потенциальный масштаб исследователи связывают с корпоративными аккаунтами, которые могли иметь доступ к GitHub, Slack, электронной почте и Google Drive. По их словам, связанный Codex открыл безвредный запрос на слияние во внутреннем монорепозитории; исследователи подчёркивают, что не читали чувствительный код. Сумма менее 3000 долларов на токены Claude относится ко всей многомесячной кампании Hacktron HEIF Heist с несколькими компаниями, а не к одной цепочке OpenAI. Hacktron сообщает, что OpenAI устранила проблему примерно через 14 часов после раскрытия и выплатила 6500 долларов за ошибку SSO. Это отчёт исследователей без публичного сообщения OpenAI, подтверждающего полную историю; возможный ущерб в миллионы остаётся сторонней оценкой.

Claude не проводил исследование автономно. Опытные специалисты выбирали направления, проверяли результаты и соединяли отдельные находки, а модель ускоряла работу, требующую знаний эксплуатации памяти, веб-аутентификации и корпоративной инфраструктуры. Из отчёта следует более узкий вывод: модель может заметно сократить время квалифицированного исследования, поэтому при оценке защиты следует учитывать скорость человеческой команды с ИИ, не приписывая инструменту самостоятельную атаку.

MiniMax открыла MiniMax Code CLI — агентную оболочку для моделей программирования. Оболочка определяет, как модель читает файлы, вызывает инструменты, запрашивает разрешения, отслеживает сделанные шаги и выбирает следующее действие. Она не привязана к единственной модели и, согласно документации проекта, может работать с разными поставщиками.

В демонстрационной оценке оболочек сочетание MiniMax Code с Kimi K3, согласно представленному графику, завершало задачи быстрее других оболочек; другой график показывал больше выполненных задач при меньшей стоимости. Эти точные результаты отсутствовали в проверенной версии официального README, поэтому остаются неподтверждёнными данными демонстрации, а не фактом о превосходстве на любом репозитории. Проект и инструкции опубликованы; собственные модели можно подключать через поддерживаемые OpenAI- и Anthropic-совместимые API, что не гарантирует одинакового поведения любой модели.

Сжатие Qwen и три открытые локальные модели

Bonsai 2 27B получена сильным сжатием Qwen3.8-27B. Метод Ternary Bonsai использует веса −1, 0 или +1 с групповым масштабированием FP16 и даёт эффективные 1,76 бита на вес. Итоговый объём — 5,9 ГБ, более чем в девять раз меньше исходной модели. По агрегату PrismML результат составляет 83,9 против 85,4, то есть 98,2% уровня полной модели. Это близкое, но не идентичное качество, причём потери различаются по задачам.

Модель поддерживает контекст 262 тыс. токенов, мультимодальный ввод и опубликована под Apache 2.0; доступен вариант MLX для устройств Apple. PrismML приводит скорость до 143 токенов в секунду на RTX 5090 и 46,8 на M5 Max. Также приводились 55,6 ГБ у базы, 5,95 ГБ у Q1 и 7,21 ГБ у Q2, но объявление PrismML не подтверждает весь этот набор вариантов. Вывод о запуске на видеокарте среднего уровня зависит от поддержки троичных вычислений и дополнительной памяти под контекст; размер файла не определяет полные требования.

Occamy 1.0 — модель среднего размера, полученная последующим обучением Qwen 3.6 35B при сохранении той же архитектуры. Заявлено 35 млрд параметров, из которых во время работы активны только 3 млрд. В представленных агентных тестах Occamy заметно превосходит базовую модель, а в отдельных задачах приближается к гораздо более крупным GPT-5.6 Sol, Qwen 3.8 Max и DeepSeek V4 Pro.

Утверждения о лучшем среднем результате и соотношении качества и цены сжимают неоднородную внутреннюю таблицу: Occamy находится рядом с выгодным краем четырёхтестового нормализованного агрегата, но крупные модели побеждают во многих отдельных строках. Карточка прямо предупреждает, что это не замена передовой модели для каждой задачи. Опубликованы основные веса и фреймворк обучения Dressage. Файл GGUF около 12 ГБ — квантование сообщества, а не главный официальный чекпойнт.

ZGCM-1 — открытая плотная модель на 7,39 млрд параметров, обученная с нуля для математических рассуждений и поиска с инструментами. Контекст составляет 256 тыс. токенов. В репозитории указаны результаты 97,13 на MATH-500, 75,00 на AIME 2026 и 70,42 на HMMT 2025. Лучший средний ранг относится только к выбранным семи моделям размера 7–8 млрд и четырнадцати тестам; сравнение включает более старых соперников и не показывает положение относительно всех актуальных систем.

Проект публикует не только веса, но и поэтапный конвейер данных и обучения под MIT с отдельными условиями для сторонних моделей и наборов данных. Это позволяет изучить способ получения результата и воспроизвести отдельные этапы, хотя оценки проведены самим проектом, а наличие рецепта не гарантирует одинаковый итог на другом оборудовании и данных.

Odyssey 3 переносит представление мира между роботами и симуляцией

Odyssey 3 завершает подборку попыткой использовать одну базовую модель мира для манипуляторов, гуманоидных роботов, автономных автомобилей, дронов и агентов видеоигр. Сначала модель учится по визуальным данным представлениям о движении, физических закономерностях, причинно-следственных связях, объектах и поведении. Затем отдельная политика действий преобразует это представление в моторные команды конкретной машины.

Общая модель мира не означает единого готового декодера для любой техники. Для разных устройств и задач обучаются отдельные политики действий, учитывающие доступные органы управления и формат команд. В демонстрациях Odyssey 3 управляет гуманоидным роботом при работе с предметами и пилотирует дрон. Ту же основу подключают к симулятору, где она управляет виртуальными персонажами или роботами.

В опыте с автономным вождением использовали 20 часов симулированных данных и небольшую политику путевых точек поверх замороженной модели мира. В закрытых испытаниях с вмешательствами безопасности Odyssey прошла, по данным разработчиков, около 77% дистанции между вмешательствами по сравнению с политиками, обученными на реальном видео. Это ранняя демонстрация на улицах Индии, а не общая проверка автономного вождения. Для робота, гуманоида, дрона и игры также понадобились отдельные политики и десятки часов данных по задачам. Главный исследовательский результат — перенос общего визуального представления между средами, а не один универсальный контроллер.

Для компании из этой недели наиболее применимы четыре направления: юридический поиск по контролируемому корпусу документов, ответы по внутренней базе знаний, локальная обработка речи и видео, а также выбор модели и оборудования под измеримую нагрузку. pommeDeTerre может спроектировать такой контур, проверить доступные открытые модели на материалах заказчика и сравнить локальный запуск с API по качеству, задержке, правам доступа и стоимости. Результатом пилота должны быть измерения и архитектура, а не обещание, что любой из новых релизов одинаково подходит всем.