Содержание курсаурок 1 из 8
- 1Мультимодальность: что модель умеет кроме текста
- 2Файлы и документы: что приложить и как спрашивать
- 3Таблицы и данные: разбор, выводы и проверка цифр
- 4Изображения на вход: фото, скриншоты, распознавание текста
- 5Генерация изображений: как описать картинку словами
- 6Правка изображений и генерация видео: что уже работает
- 7Голос: диктовка, расшифровка встреч, разговор с ИИ
- Итоговый проект: мультимодальная задача
Мультимодальность: что модель умеет кроме текста
Обзор возможностей, которые не видны на первом экране чата, и правило, по которому понятно, какие из них у вас есть.
После этого урока
Сможете за минуту выяснить, что умеет ваш сервис кроме переписки, и перестанете пересказывать то, что можно приложить.
Большинство людей пользуется нейросетью как чатом: пишут текст, получают текст. При этом рядом, часто в одной кнопке, лежат возможности, которые экономят в разы больше времени.
Что такое мультимодальность
Модальность — это вид данных: текст, изображение, звук, видео. Мультимодальная модель понимает несколько видов сразу и может переводить между ними.
На практике это значит, что одной и той же модели можно дать фотографию и спросить о ней словами, приложить документ и попросить найти в нём условие, наговорить голосом вместо набора.
Ещё пару лет назад под каждую задачу был отдельный сервис. Сейчас всё чаще достаточно одного — и это главное изменение, которое стоит заметить.
Шесть возможностей, которые стоит проверить у своего сервиса
- Приложить файл: PDF, документ, таблицу — и задавать вопросы по содержимому.
- Приложить изображение: фото, скриншот, схему — и спросить, что на нём.
- Распознать текст с картинки: снимок страницы, вывеска, рукописная записка.
- Сгенерировать изображение по описанию.
- Наговорить запрос голосом вместо набора.
- Расшифровать аудиозапись в текст.
Часть из них может быть только на платном тарифе — это как раз тот случай из восьмого урока первого курса, когда подписка окупается конкретной функцией.
Промпт для инвентаризации возможностей
Перечисли, что ты умеешь принимать от меня кроме текста: файлы каких форматов, изображения, звук. Отдельно скажи, что из этого доступно на моём тарифе, а что нет. Если чего-то не знаешь про мой тариф — так и напиши, не угадывай.
Ответ сверьте со справкой сервиса: про собственные ограничения модели ошибаются чаще всего.
Приложить всегда лучше, чем пересказать
Это главное практическое следствие всего курса. Копируя текст договора в чат, вы теряете разметку, таблицы и сноски. Пересказывая своими словами — теряете детали, которых не заметили. Оригинал позволяет модели увидеть то, что упустили вы.
Чего мультимодальность не меняет
Всё, что вы знаете из первого курса, остаётся в силе. Модель по-прежнему достраивает недостающее — и с картинками делает это так же охотно, как с текстом. Скажем, на размытом снимке документа она «прочитает» цифру, которой не видно.
Поэтому правило проверки не меняется: то, что можно сверить с оригиналом, сверяют.
Как понять, что вам это нужно
Простой признак: если вы хоть раз перепечатывали что-то с бумаги, пересказывали содержимое файла словами или расшифровывали запись вручную — вы делали работу, которую делать не нужно.
Какие сервисы что умеют, отмечено в разделе «Нейросети». Здесь мы разбираем приёмы, а не конкретные кнопки: кнопки переезжают, приёмы остаются.
Практика
Проведите инвентаризацию за пять минут.
- Откройте свой основной сервис и найдите кнопку прикрепления файла.
- Попробуйте приложить любой документ и спросить о нём что-нибудь конкретное.
- Попробуйте приложить фотографию и спросить, что на ней.
- Найдите кнопку микрофона и наговорите запрос вместо набора.
- Отметьте, что из этого у вас работает, — дальше курс будет опираться на это.
Типичные ошибки
Пользоваться нейросетью только как чатом
Возможности, экономящие больше всего времени, спрятаны за кнопкой прикрепления файла.
Пересказывать документ вместо того, чтобы приложить
Пересказ теряет детали, а копирование текста — таблицы и разметку.
Верить модели насчёт её собственных ограничений
Про свой тариф и свои функции модели ошибаются особенно часто. Сверяйте со справкой сервиса.
Проверьте себя
Ответы нигде не сохраняются — отвечайте спокойно и пробуйте сколько нужно.
1. Что означает «мультимодальная модель»?
2. Почему документ лучше приложить, чем скопировать текстом?
Коротко
- Мультимодальность — понимание нескольких видов данных одной моделью.
- Шесть возможностей: файлы, изображения, распознавание текста, генерация картинок, голосовой ввод, расшифровка.
- Приложить оригинал всегда лучше, чем пересказать или скопировать текстом.
- С картинками модель достраивает так же охотно, как с текстом: проверка не отменяется.