В пятницу на закрытии IJCAI–ECAI объявляли результаты соревнований, благодарили волонтёров и называли следующий город. За три дня до этого на той же сцене Ян Петерс рассказывал, как робот сломался после обучения в симуляторе: алгоритм нашёл в модели ошибку физики и стал извлекать из неё «бесплатную энергию». Эти две сцены задают масштаб конференции лучше общего слова «ИИ»: от устройства международного научного сообщества до очень конкретного удара робота о реальный мир.

Официальная страница Video Recordings перечисляет 11 записей главной сцены, прошедших в Бремене 18–21 августа: церемонии, восемь выступлений и Robotics Panel. Мы посмотрели все эти записи. Это не попытка пересказать всю конференцию: в архив не входят параллельные доклады по статьям, туториалы и воркшопы.

На открытии конференции Франческа Тони представила программу и организаторов: IJCAI, EurAI, Бременский университет, Bremen Research Alliance, Немецкий исследовательский центр искусственного интеллекта и Gesellschaft für Informatik. Конференция стала частью городского Summer of AI — серии публичных мероприятий Бремена с июня по сентябрь.

Церемония показывает и устройство самой научной встречи: основной и специальные треки, работы из журналов и смежных конференций, выступления молодых исследователей, соревнования и награды. Премию Джона Маккарти в 2026 году получил Дэвид Паркс, чей доклад о правилах для общества агентов прозвучал позднее на той же сцене.

Агент — это не просто чат с моделью

Ник Дженнингс начал с того, что идея агента старше нынешней волны языковых моделей. В его рассказе агент — программа, которая получает задачу, хранит состояние, обращается к окружению и выбирает следующие действия. Языковая модель сделала разговор с такой программой проще, но не добавила автоматически поиск данных, выполнение действий и проверку результата. Запись Дженнингса построена именно на этом различии.

Его ранние примеры не похожи на современные демонстрации чата. Под норвежским ледником двигался лёд, садились батареи, а добраться до датчика и заменить питание было нельзя. Передать наблюдение через соседа означало сохранить данные всей сети, но быстрее разрядить батарею посредника. Исследователям пришлось заложить в систему не личную «бережливость» каждого устройства, а общую цель: как можно дольше не потерять голос ледника.

Дэвид Паркс продолжил эту линию уже на примере общества агентов. В его учебной игре один виртуальный почтальон скрывает близкое письмо, чтобы второй всё равно проехал дальний маршрут и взял на себя больше работы. Первому становится выгоднее, общему решению — хуже. В другом примере два агента называют оценки хот-дога; победитель платит не свою ставку, а предложение второго. Доклад Паркса не обещает, что такая схема подходит для каждого рынка. Он показывает, почему правила обмена информацией и расчёта цены меняют поведение участников.

В конце оба доклада сходятся на менее эффектной, но важной вещи. Если несколько программ действуют от чьего-то имени, нужно видеть, что они сделали, по каким данным и можно ли это проверить. У Паркса это звучит как проблема наблюдаемости и проверяемости; у Дженнингса — как вопрос безопасности и человеческого контроля.

Дженнингс не сводит агента к модели, которая вызывает функции. В его определении важны состояние, окружение и другие участники. Поэтому примеры доклада идут от сети датчиков к распределению задач, ремонту и работе с данными после землетрясения в Непале. В каждом случае проблема не в том, чтобы один раз подобрать ответ, а в том, чтобы несколько источников и исполнителей продолжали работать, когда у них разные сведения и разные интересы.

У Паркса этот конфликт показан особенно ясно в аукционном примере. Победитель платит не свою названную цену, а цену второго участника. Смысл не в том, что любой торг нужно заменить такой схемой: доклад разбирает условия, при которых правило даёт участнику стимул назвать настоящую оценку. Дальше он переносит вопрос на контракты и механизмы, которые можно проектировать или обучать, сохраняя проверяемые свойства правил.

Когда у людей нет одного ответа

Барбара Планк посвятила свой доклад «мифу об эталонной истине» — привычке оставлять для примера в наборе данных одну «правильную» метку. Она показывает изображения и тексты, на которые люди отвечают по-разному: оценивают улыбку, профессию на фотографии, токсичность или смысл сообщения. В таких задачах разногласие может быть не браком разметки, а описанием того, что люди действительно увидели по-разному.

Барбара Планк выступает за трибуной на сцене IJCAI–ECAI 2026 в Бремене
Барбара Планк разбирала случаи, в которых разногласие между людьми содержит информацию и не должно автоматически считаться ошибкой.Кадр: IJCAI–ECAI 2026, официальная запись

Если сохранить только мнение большинства, модель выучит уверенный ответ там, где уверенности не было. Планк рассказывает о подходах, которые сохраняют отдельные ответы разметчиков, их уверенность и условия, в которых они принимали решение. Это не означает, что все трактовки равны. Речь о том, чтобы система не выдавала спорный вопрос за бесспорный факт.

Отдельно она разбирает языковые модели как условных участников опросов. Один и тот же заданный профиль даёт разные результаты в зависимости от того, просить модель выбрать вариант, написать ответ или брать её вероятности. Поэтому такой эксперимент может говорить о механике модели и формулировке запроса, но сам по себе не измеряет мнение реальных людей.

На одном из слайдов — фотография человека и простой с виду вопрос о его профессии. Но снимок не сообщает биографию: разметчик вынужден угадывать её по одежде, обстановке и собственным представлениям. То же происходит с улыбкой или резкой репликой: один видит радость, другой — неловкость; один читает шутку, другой — оскорбление. Когда все голоса сводят к одной метке, исчезает не только шум. Исчезают люди, которые увидели сцену иначе.

Планк предлагает хранить распределение ответов и сведения о процессе разметки. Тогда исследователь видит, где люди почти единодушны, а где решение держится на небольшом перевесе. Для оценки модели это меняет вопрос: вместо простого совпадения с большинством можно проверить, отражает ли модель неопределённость и не становится ли необоснованно уверенной.

Эксперимент с языковыми моделями усиливает этот аргумент. Если «синтетический респондент» меняет позицию из-за формата ответа, нельзя считать его дешёвой заменой опроса людей. Показанный результат прежде всего описывает чувствительность модели к инструкции и способу считывания вероятностей.

Мир на видео и мир, в котором действует робот

Цзяцзюнь У говорит о «коде физического мира»: геометрии предметов, материалах, свете, положении камеры, движении и причинных связях. В его докладе проблема компьютерного зрения сформулирована так: по картинке или видео нужно восстановить не только внешний вид, но и возможное устройство сцены. Интернет даёт много изображений и текста, но мало данных, где эти физические свойства уже размечены.

Поэтому группа У соединяет нейронные модели с более явными трёхмерными и физическими представлениями. В показанных работах система может получать изображение и заданное воздействие на объект, а затем генерировать видео его предполагаемой реакции. На вопрос из зала о количественной проверке У прямо ответил: показанные примеры происходят из разных исследований, и у каждого свои данные и измерения. Красивый ролик сам по себе не заменяет такую проверку.

Ян Петерс говорит о той же дистанции между моделью и реальностью со стороны робототехники. Его история о сломанном роботе — не свежий инцидент конференции, а урок из ранней работы: алгоритм воспользовался маленькой физической неточностью симулятора. В докладе Петерса из этого вырастает аргумент за ограничения при обучении. Роботу для аэрохоккея нельзя сначала позволить ударить во все стороны, а потом штрафовать за столкновение: повреждённую машину штраф не починит.

Затем на экране робот без камер ставит ногу на скейтборд и удерживает равновесие. На несколько секунд это выглядит почти как фокус. Петерс тут же возвращает зрителя к условиям опыта: машине заранее примерно известно положение доски, она чувствует собственные суставы, а движение отработано в симуляции. Номер не становится менее интересным — просто чудо снова превращается в инженерную задачу с перечисленными границами.

Полный 29-секундный демонстрационный фрагмент из доклада Яна Петерса. Крест на голове закрывает камеры: робот ориентируется по внутренним датчикам и заданному начальному представлению о доске.Видео: IJCAI–ECAI 2026 / DFKI / IAS

У начинает с обратной связи между компьютерной графикой и зрением. В графике известны геометрия, материал, свет и камера, из которых строится изображение. Зрение решает обратную задачу: по готовому изображению пытается восстановить возможные параметры сцены. Одного правильного ответа часто нет — одинаковый кадр могли создать разные формы, материалы и источники света.

Поэтому в работах его группы система выдаёт не только один объект, но и распределение возможных свойств. Синтетические данные здесь нужны потому, что для созданной сцены известны точные параметры. В реальном видео приходится дополнять их многокамерной съёмкой и измерениями. На вопрос о термине «модель мира» У отвечает осторожно: одни исследователи называют так явное трёхмерное описание, другие — модель, которая предсказывает следующий кадр или скрытое состояние.

У Петерса ограничения появляются ещё до первого опасного движения. В аэрохоккее допустимую область задают так, чтобы манипулятор не ударил себя или окружающее оборудование во время исследования. Это не штраф после ошибки, а запрет на часть действий. Разница существенна именно для физической машины: симуляцию можно перезапустить, сломанный привод — нет.

Доклад также связывает ограничения с переносом навыков между роботами. Полностью ручная физическая модель слишком неточна, а обучение без предпосылок требует слишком много опасных проб. Петерс ищет промежуточный вариант: геометрия, динамика и устройство тела задают форму обучения, но конкретное движение всё равно уточняется по данным.

Правила в коде и представления в изображении

Лучано Серафини объясняет нейросимвольный подход: нейросети работают с данными и приближёнными оценками, а логические формулы записывают явные отношения и ограничения. Его группа развивает Structural Logic Tensor Networks — систему, где логические выражения переводятся в тензорные вычисления. В записи он показывает пример с видео: если система считает, что режут помидор, правило связывает это действие с наличием помидора и ножа.

Такое правило оценивается не как абсолютное «да» или «нет», а по степени выполнения. Серафини отдельно предупреждает о словах вроде «для всех»: в классической логике это все возможные объекты, а при обучении система работает с конечным набором данных. Нужен способ собрать оценки по этому набору, и от его выбора меняется, как система учится.

Тинне Тёйтелаарс обсуждает соседнюю проблему — визуальные представления. Хорошее представление, по её словам, должно сохранять информацию для нужной задачи и отбрасывать шум. В её обзоре речь идёт о контрастивном обучении, маскировании частей изображений и работах, где соответствия ищут между разными снимками, а текст помогает выделять объекты на изображении. Большие модели не отменили этот вопрос: всё, что модель сделает потом, зависит от того, что её внутреннее представление сохранило и что потеряло.

В Structural Logic Tensor Networks символы и отношения становятся тензорными выражениями, которые можно вычислять вместе с нейронной сетью. Формула «если режут помидор, в сцене должны быть помидор и нож» не заменяет распознавание изображения: она добавляет связь между несколькими предсказаниями. При обучении система старается повысить степень выполнения и правил, и наблюдаемых фактов.

Самая неудобная часть возникает с квантором «для всех». Минимальная оценка соответствует интуиции: правило истинно настолько, насколько истинен худший случай. Но один плохой пример тогда определяет весь градиент и мешает обучению. Другие агрегаторы распределяют влияние между примерами, однако уже не полностью совпадают с классическим смыслом всеобщности. Серафини показывает это как реальный выбор модели, а не как решённую деталь.

Тёйтелаарс разделяет методы без полной ручной разметки на несколько линий. Контрастивные методы сближают представления связанных изображений и отдаляют несвязанные; методы без отрицательных пар пытаются избежать такого сравнения; маскирование заставляет восстановить скрытую часть изображения. У каждого подхода свой ответ на вопрос, какая информация считается существенной.

В работе о соответствии между изображениями группа ищет точки и части объектов, которые сохраняются в разных кадрах. Цикл соответствия служит проверкой: если переход от первого изображения ко второму и обратно не возвращает систему к исходной области, такую пару не используют как надёжный сигнал. В другой работе текст помогает связать визуальные кластеры с понятиями из подписи, но качество связи по-прежнему зависит от содержания самих подписей.

Панель о роботах и доклад о доступе к науке

На панели о робототехнике участники спорили с распространённой идеей, что одна очень большая модель зрения, языка и действий сама решит проблемы роботов. Такая модель получает изображение и текст, а выдаёт команду действия. Обсуждались расход энергии, вычисления на устройстве, аппаратная часть, модель человека и последствия действий. Спор о том, «понимает» ли робот свои действия, участники переводили в практический вопрос: можно ли доверять системе, которая не умеет представлять последствия своих действий.

Последнее основное выступление, IJCAI In the World, Георгины Курто было не о новой архитектуре. Она говорила о том, кто получает возможность заниматься исследованиями: о финансировании, визах, инфраструктуре, конфликтах, доступе к данным и местных задачах. В примерах звучали работа в Африке, онлайн-обучение девушек в Афганистане и участие исследователей из стран, где идут конфликты.

Этот доклад важен рядом с разговорами о больших моделях и дорогом оборудовании. Конференция может обсуждать более безопасные роботы и лучшие правила для агентов, но доступ к самим лабораториям, данным и площадкам распределён неравномерно. Курто не предлагает один готовый рецепт; она рассказывает о небольших программах, партнёрствах и ограничениях, которые нельзя убрать одним онлайн-созвоном.

На панели участники несколько раз возвращаются к энергопотреблению. Большая модель может выглядеть убедительно в лабораторной демонстрации, но мобильный или домашний робот ограничен батареей, теплом и вычислительным модулем. Перенести всё в облако тоже нельзя считать нейтральным решением: появляются задержка, сеть и вопрос о том, какие данные покидают устройство.

Медицинские и домашние сценарии делают спор о понимании менее философским. Если робот действует рядом с человеком, недостаточно получить правдоподобную команду движения. Система должна учитывать положение человека, допустимую силу, состояние механики и последствия ошибки. Поэтому участники говорят о сочетании обучения, явных моделей и инженерных ограничений.

Курто переносит разговор с возможностей системы на возможность исследователя вообще оказаться в этом зале. Хорошей работы недостаточно: нужны вычисления, данные, деньги на дорогу и виза. Небольшая школа или онлайн-курс могут открыть первую дверь там, где нет крупной лаборатории, но за ней остаются следующие. Поэтому мечта о конференции в Африке сразу обрастает будничными вопросами: где собрать людей, как они доберутся и кто оплатит площадку.

От Бремена к Барселоне

Открытие и закрытие обрамляют эти разговоры наградами, соревнованиями, статистикой заявок и планами следующей конференции в Барселоне. Но содержательная нить в записях другая. Автономная программа оказывается не только моделью; ей нужны правила, данные, наблюдение и границы действий. Робот оказывается не только демонстрацией движения; ему нужны условия, в которых это движение не разрушит машину или человека.

В одиннадцати видео слова «агент» и «модель мира» чаще приводят к конкретным вопросам, чем к обещаниям общего интеллекта: кто сообщает информацию, что видит проверяющий, какие данные нельзя свести к одной метке и что произойдёт, когда симуляция встретится с реальным оборудованием.

На закрытии сначала объявляют результаты соревнований. Среди показанных задач — выявление поддельных удостоверений личности. Затем программные председатели разбирают заявки, принятые работы и географию участников, а организаторы обсуждают, как использовать взносы за непервичные статьи на следующей конференции.

Международная ассоциация национальных организаций в области ИИ приняла объединение из Северной Македонии и сообщила, что теперь включает 25 организаций. Следующая IJCAI должна пройти в Барселоне; на закрытии назвали генерального председателя Карлеса Сьерру, программных председателей Ронни Стерна и Луиса Траве и местную команду.

Так финальная церемония возвращает разговор от моделей к институтам. Правила нужны не только виртуальным почтальонам Паркса: конференция тоже распределяет внимание, деньги, поездки и право быть услышанным. Доклад Курто делает эту связь явной, а статистика и планы Барселоны показывают, где она будет проверяться дальше.