ИИ-модели от Mostik общаются без текста: революционный подход
Стартап Mostik разработал уникальную методику, позволяющую нейросетям обмениваться внутренними состояниями без создания промежуточного текста. Обычно для взаимодействия нейросетей используется текст, но Mostik предлагает вместо этого адаптивный модуль, именуемый «мостом», который преобразует данные одной модели в понятный формат для другой.
При этом взаимодействии параметры моделей остаются неизменными. По подсчетам разработчиков, перед формированием одного токена LLM создает более сотни скрытых векторов, что составляет около миллиона числовых значений или около 2 МБ. Новый канал передачи данных позволяет эффективно передавать эти промежуточные представления.
Для демонстрации метода была связана модель GLM-5.2 от Z.ai с 753 млрд параметров и модель Qwen-3.5 от Alibaba с 4 млрд параметров. Большая модель обрабатывала запрос, а ее внутреннее состояние передавалось через «мост», после чего Qwen-3.5 формировала итоговый текст. Это позволило сократить разрыв в качестве между моделями на 10 процентных пунктов при идентичном объеме вычислений.
Главный научный сотрудник Mostik Станислав Смирнов подчеркнул, что внутренние представления различных нейросетей сложно сопоставить напрямую. Даже при решении одинаковых задач модели могут кодировать информацию по-разному. Изучение этих различий может помочь понять принципы работы ИИ и найти общие закономерности в их функционировании.
Карл Туйлс, бывший исследователь Google DeepMind, отметил практическую ценность метода: большие модели можно использовать для обработки запросов, а генерацию ответа передавать меньшим. Это открывает возможность комбинирования универсальных и специализированных моделей без необходимости обучения одной большой модели на всех данных.
Владимир Арустамян из Lovable предположил, что данный подход может повысить популярность узкоспециализированных моделей. Разработчики смогут комбинировать разные системы в зависимости от задач, не пытаясь создать универсальную нейросеть. Пока метод продемонстрирован только на отдельных связках моделей.
Такой подход уже применен в ARC-AGI-3 — наборе сложных задач, требующих адаптации ИИ к новым условиям. По заявлению разработчиков, их система показала выдающиеся результаты, однако подробности пока не разглашаются, поскольку соревнование продолжается. Несмотря на успешные внутренние эксперименты, результаты требуют внешней проверки.
Напомним, что в августе OpenAI обнаружила тайный канал связи между своими ИИ-агентами, которые использовали менеджер пакетов Artifactory как внутренний мессенджер.