Корона

Нейросеть научилась показывать пальцем: указывать на объекты на картинке и пересчитывать их

Ai2работа от 25 сентября 2024 г.3 мин чтения
Схема: картинка, на которой пять объектов отмечены оранжевыми точками с номерами
Схема: редакция «Короны»

Модели, которые понимают картинки, обычно отвечают словами: «на фото пять яблок». Проверить, правда ли это, трудно. Allen Institute for AI и Вашингтонский университет выпустили семейство открытых моделей Molmo, которые умеют указывать: ставить точку на каждом объекте. Старшая модель на 72 миллиарда параметров, по оценке авторов, обошла Claude 3.5 Sonnet и Gemini 1.5 Pro и уступила только GPT-4o.

Что именно исследовали

Лучшие модели «зрение + язык» закрыты. Открытые часто обучают на ответах закрытых моделей — по сути, копируют их. Из-за этого сообщество не знает, как сделать сильную модель с нуля.

Авторы собрали собственные данные людьми, без помощи других моделей, и выложили в открытый доступ и веса, и данные, и код.

Как это работает

Люди описывали картинки голосом по 60–90 секунд — так описания получались гораздо подробнее, чем письменные. Записи расшифровывали. Получилось около 1,3 миллиона подробных описаний для 712 тысяч изображений.

Отдельный набор данных — указания. Разметчики называли объект и ставили точку на каждом его экземпляре на картинке. Всего 2,3 миллиона пар «вопрос — точки» на 223 тысячах изображений.

В ответ модель выдаёт координаты точек. Представьте, что вместо «здесь пять яблок» она касается пальцем каждого яблока по очереди — так и считать надёжнее, и проверить легко.

Что ИИ теперь умеет

  • Указывать на объект на изображении по описанию словами
  • Считать предметы, отмечая каждый точкой
  • Показывать, на какие места картинки опирается ответ

Что показал эксперимент

Molmo-72B. По академическим бенчмаркам и по большой оценке людьми — лучшая среди моделей с открытыми весами и данными. Обходит Claude 3.5 Sonnet, Gemini 1.5 Pro и Gemini 1.5 Flash, уступает только GPT-4o.

Molmo-7B-D. Средний балл 77,3 на 11 академических бенчмарках — между GPT-4V и GPT-4o.

Веса, данные PixMo и код открыты. Младшие модели можно скачать на Hugging Face.

Что пока не работает

  • В обучении не было примеров, где объектов больше 40, — большие количества модель считает хуже.
  • На задачах со сложными рассуждениями (MMMU, MathVista) Molmo отстаёт: в обучении мало таких данных.
  • После обучения на картинках языковая модель внутри немного теряет знания в чисто текстовых задачах.
  • Указание точками хуже работает, если картинку нарезают на другое число фрагментов, чем при обучении.

Почему это важно

Указание точкой — простой способ связать слова с конкретным местом на изображении. Такая связка нужна везде, где ИИ должен не только описывать, но и действовать: нажимать на кнопку в интерфейсе, брать предмет рукой робота.

Не менее важно, что работа полностью открыта: веса, данные и рецепт обучения можно проверить и повторить.

Можно ли попробовать

Оригинальное исследование

Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Авторы
Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang и др. (50 авторов)
Организация
Allen Institute for AI, University of Washington
Дата
25 сентября 2024 г.
Тип
Научная статья
Разбор опубликован 21 сентября, 16:13Поделиться

Ещё исследования

Схема: контур головы с датчиками вокруг, пунктир к клавишам с буквами «привет»
AI Science

ИИ научился восстанавливать набранные предложения по сигналам мозга — без операции

Brain2Qwerty v2 от Meta и французских научных центров восстанавливает набираемые предложения по записи мозга снаружи головы. В среднем ошибочны 39% слов, у лучшего участника половина фраз — с ошибкой не больше чем в одном слове.

Meta AI Researchиюнь 2026 · 3 мин
ИИ научился восстанавливать набранные предложения по сигналам мозга — без операции
Схема человекоподобного робота, который приседает и тянется к оранжевому ящику
Robotics

Человекоподобные роботы научились работать всем телом: ходить, приседать и брать предметы в одной модели

Gemini Robotics 2 от Google DeepMind управляет не только руками, но и всем телом человекоподобного робота, а также тонкими движениями многопалых кистей. Версия для работы на самом роботе адаптируется к новой машине за несколько часов.

Google DeepMindиюль 2026 · 2 мин
Человекоподобные роботы научились работать всем телом: ходить, приседать и брать предметы в одной модели
Схема: план квартиры и оранжевый пунктир — путь робота между задачами
Robotics

Робот научился убирать в квартире, которую никогда не видел

Модель π0.5 от Physical Intelligence управляет роботом в незнакомых домах: убирает посуду, заправляет кровать, собирает бельё. Сначала она решает словами, что делать дальше, а потом выполняет движение.

Physical Intelligenceапрель 2025 · 3 мин
Робот научился убирать в квартире, которую никогда не видел