Мультимодальность — текст, картинки и звук
Способность модели работать сразу с несколькими типами данных: понимать изображение, слушать речь и отвечать текстом в одном запросе.
Также встречается как: multimodal, мультимодальные модели
Коротко. Мультимодальная модель принимает и порождает не только текст: изображения, аудио, видео, документы. Один запрос может содержать фотографию и вопрос о ней.
Что это даёт продуктам
Документы без разметки. Фотография накладной, скриншот, скан договора — модель извлекает данные без отдельного распознавания текста и правил разбора.
Голос как интерфейс. Речь на входе и на выходе снимает необходимость печатать — критично для полевых сотрудников, водителей, производства.
Проверка по фото. Соответствие сборки чертежу, состояние объекта, комплектность отгрузки.
Разбор экрана. Пользователь присылает скриншот проблемы вместо описания.
Зачем фаундеру
Целый класс задач, ещё недавно требовавших отдельной разработки и обучения моделей, теперь решается запросом к готовому API. Это резко удешевляет проверку гипотез в отраслях, где данные существуют в виде фотографий и бумаг, — производство, логистика, стройка, ремонт.
Практический совет: прежде чем строить свой распознаватель, проверьте задачу на готовой мультимодальной модели. Часто этого достаточно.
Где ошибаются
Считают точность гарантированной. Модель уверенно ошибается в цифрах на плохом снимке — критичные значения нужно подтверждать.
Не считают стоимость. Изображения расходуют заметно больше токенов, чем кажется по объёму текста на них.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.