Содержание курсаурок 6 из 8
- 1Мультимодальность: что модель умеет кроме текста
- 2Файлы и документы: что приложить и как спрашивать
- 3Таблицы и данные: разбор, выводы и проверка цифр
- 4Изображения на вход: фото, скриншоты, распознавание текста
- 5Генерация изображений: как описать картинку словами
- 6Правка изображений и генерация видео: что уже работает
- 7Голос: диктовка, расшифровка встреч, разговор с ИИ
- Итоговый проект: мультимодальная задача
Правка изображений и генерация видео: что уже работает
Четыре операции с готовыми картинками, которые экономят время, честная оценка видео — и разговор о границе, которую не стоит переходить.
После этого урока
Сможете отличить задачи, которые ИИ с изображениями решает надёжно, от тех, где он пока только обещает.
Генерация с нуля — самая громкая часть, но в работе чаще нужна правка уже имеющегося. Тут результаты заметно надёжнее.
Четыре операции, которые работают хорошо
Убрать фон. Самая отработанная операция. Нужна для карточек товара, портретов, коллажей. Ошибается на волосах, мехе и прозрачных предметах — их проверяйте.
Убрать лишнее. Провод в кадре, случайный прохожий, мусор на столе. Модель дорисовывает то, что было за объектом. На однородном фоне выходит незаметно, на сложном — видны следы.
Расширить кадр. Фотография вертикальная, а нужна горизонтальная — модель дорисовывает края. Полезно, когда исходник обрезан неудачно.
Увеличить разрешение. Старое маленькое фото можно увеличить без каши. Важно понимать: недостающие детали не восстанавливаются, а придумываются правдоподобно. Для семейного архива это прекрасно, для опознания номера на фотографии — недопустимо.
Увеличение не восстанавливает, а дорисовывает
Это тот же механизм достраивания, что и в тексте. На увеличенном снимке лицо может стать чётким — но это не то лицо, которое там было, а правдоподобное. Использовать такие изображения как доказательство чего-либо нельзя.
Генерация видео: честная оценка
Видео — самая молодая область, и разрыв между показательными роликами и повседневным результатом здесь больше всего.
Что получается: короткие фрагменты в несколько секунд, оживление фотографии, простое движение камеры, абстрактные и атмосферные вставки.
Что не получается: длинное связное видео с сюжетом, один и тот же персонаж от сцены к сцене, точная синхронизация речи и губ без отдельных инструментов, предсказуемый результат с первой попытки.
Практический вывод: закладывайте много попыток и не планируйте проект, критически зависящий от конкретного ролика.
Граница, которую не стоит переходить
С изображениями реальных людей начинается территория, где техническая возможность не означает допустимости.
- Изображение узнаваемого человека в ситуации, которой не было, — это подделка, как бы хорошо она ни выглядела.
- В России изображение гражданина охраняется законом: использовать его, как правило, можно только с согласия самого человека.
- Синтез чужого голоса без разрешения — то же самое, и в последние годы это стало массовым инструментом мошенников.
- Даже безобидная шутка с лицом знакомого расходится дальше, чем вы рассчитывали, и живёт в интернете дольше, чем вы помните о ней.
Простое правило: если человека на изображении можно узнать и он не давал согласия — не делайте. Это тот случай, где «все так делают» не аргумент.
Помечайте сгенерированное
Если изображение или видео создано нейросетью и может быть принято за настоящую съёмку — скажите об этом. Не из формальности: доверие к вашим материалам ломается один раз и восстанавливается годами.
Что проверять в отредактированном
- Границы объектов: пальцы, волосы, тонкие линии — там следы правки заметнее всего.
- Дорисованные края при расширении кадра: не появилось ли там нелепостей.
- Текст и цифры на изображении: при увеличении они меняются охотнее всего.
- Отражения и тени: их модель часто забывает согласовать с правкой.
Практика
Проверьте, что увеличение придумывает детали.
- Возьмите фотографию, где есть мелкий текст: вывеска, этикетка, номер.
- Уменьшите её так, чтобы текст перестал читаться.
- Увеличьте обратно с помощью ИИ-инструмента.
- Сравните полученный текст с оригиналом. Скорее всего, он читается — и не совпадает.
Типичные ошибки
Считать увеличенное изображение восстановленным
Детали придумываются правдоподобно. Как доказательство такие изображения не годятся.
Планировать проект вокруг конкретного сгенерированного ролика
Видео пока непредсказуемо. Нужен запас попыток и запасной вариант.
Делать изображения узнаваемых людей без согласия
Изображение гражданина охраняется законом, а подделка остаётся подделкой независимо от качества.
Не помечать сгенерированное, когда его можно принять за съёмку
Доверие к вашим материалам ломается один раз и восстанавливается годами.
Проверьте себя
Ответы нигде не сохраняются — отвечайте спокойно и пробуйте сколько нужно.
1. Можно ли использовать ИИ-увеличение, чтобы прочитать номер на размытой фотографии?
2. Какое правило работает с изображениями реальных людей?
Коротко
- Надёжно работают: удаление фона, удаление лишнего, расширение кадра, увеличение.
- Увеличение придумывает детали, а не восстанавливает их.
- Видео пока непредсказуемо: короткие фрагменты да, связный сюжет нет.
- Узнаваемый человек без согласия — граница, за которую не заходят.