Корона
Курс 4Урок 1 из 88 мин

Мультимодальность: что модель умеет кроме текста

Обзор возможностей, которые не видны на первом экране чата, и правило, по которому понятно, какие из них у вас есть.

После этого урока

Сможете за минуту выяснить, что умеет ваш сервис кроме переписки, и перестанете пересказывать то, что можно приложить.

Большинство людей пользуется нейросетью как чатом: пишут текст, получают текст. При этом рядом, часто в одной кнопке, лежат возможности, которые экономят в разы больше времени.

Что такое мультимодальность

Модальность — это вид данных: текст, изображение, звук, видео. Мультимодальная модель понимает несколько видов сразу и может переводить между ними.

На практике это значит, что одной и той же модели можно дать фотографию и спросить о ней словами, приложить документ и попросить найти в нём условие, наговорить голосом вместо набора.

Ещё пару лет назад под каждую задачу был отдельный сервис. Сейчас всё чаще достаточно одного — и это главное изменение, которое стоит заметить.

Шесть возможностей, которые стоит проверить у своего сервиса

  • Приложить файл: PDF, документ, таблицу — и задавать вопросы по содержимому.
  • Приложить изображение: фото, скриншот, схему — и спросить, что на нём.
  • Распознать текст с картинки: снимок страницы, вывеска, рукописная записка.
  • Сгенерировать изображение по описанию.
  • Наговорить запрос голосом вместо набора.
  • Расшифровать аудиозапись в текст.

Часть из них может быть только на платном тарифе — это как раз тот случай из восьмого урока первого курса, когда подписка окупается конкретной функцией.

Промпт для инвентаризации возможностей

Перечисли, что ты умеешь принимать от меня кроме текста: файлы каких форматов, изображения, звук. Отдельно скажи, что из этого доступно на моём тарифе, а что нет. Если чего-то не знаешь про мой тариф — так и напиши, не угадывай.

Ответ сверьте со справкой сервиса: про собственные ограничения модели ошибаются чаще всего.

Приложить всегда лучше, чем пересказать

Это главное практическое следствие всего курса. Копируя текст договора в чат, вы теряете разметку, таблицы и сноски. Пересказывая своими словами — теряете детали, которых не заметили. Оригинал позволяет модели увидеть то, что упустили вы.

Чего мультимодальность не меняет

Всё, что вы знаете из первого курса, остаётся в силе. Модель по-прежнему достраивает недостающее — и с картинками делает это так же охотно, как с текстом. Скажем, на размытом снимке документа она «прочитает» цифру, которой не видно.

Поэтому правило проверки не меняется: то, что можно сверить с оригиналом, сверяют.

Как понять, что вам это нужно

Простой признак: если вы хоть раз перепечатывали что-то с бумаги, пересказывали содержимое файла словами или расшифровывали запись вручную — вы делали работу, которую делать не нужно.

Какие сервисы что умеют, отмечено в разделе «Нейросети». Здесь мы разбираем приёмы, а не конкретные кнопки: кнопки переезжают, приёмы остаются.

Практика

Проведите инвентаризацию за пять минут.

  1. Откройте свой основной сервис и найдите кнопку прикрепления файла.
  2. Попробуйте приложить любой документ и спросить о нём что-нибудь конкретное.
  3. Попробуйте приложить фотографию и спросить, что на ней.
  4. Найдите кнопку микрофона и наговорите запрос вместо набора.
  5. Отметьте, что из этого у вас работает, — дальше курс будет опираться на это.

Типичные ошибки

  • Пользоваться нейросетью только как чатом

    Возможности, экономящие больше всего времени, спрятаны за кнопкой прикрепления файла.

  • Пересказывать документ вместо того, чтобы приложить

    Пересказ теряет детали, а копирование текста — таблицы и разметку.

  • Верить модели насчёт её собственных ограничений

    Про свой тариф и свои функции модели ошибаются особенно часто. Сверяйте со справкой сервиса.

Проверьте себя

Ответы нигде не сохраняются — отвечайте спокойно и пробуйте сколько нужно.

  1. 1. Что означает «мультимодальная модель»?

  2. 2. Почему документ лучше приложить, чем скопировать текстом?

Коротко

  • Мультимодальность — понимание нескольких видов данных одной моделью.
  • Шесть возможностей: файлы, изображения, распознавание текста, генерация картинок, голосовой ввод, расшифровка.
  • Приложить оригинал всегда лучше, чем пересказать или скопировать текстом.
  • С картинками модель достраивает так же охотно, как с текстом: проверка не отменяется.