К содержимому
AI и данные

Мультимодальность — текст, картинки и звук

Способность модели работать сразу с несколькими типами данных: понимать изображение, слушать речь и отвечать текстом в одном запросе.

Также встречается как: multimodal, мультимодальные модели

Коротко. Мультимодальная модель принимает и порождает не только текст: изображения, аудио, видео, документы. Один запрос может содержать фотографию и вопрос о ней.

Что это даёт продуктам

Документы без разметки. Фотография накладной, скриншот, скан договора — модель извлекает данные без отдельного распознавания текста и правил разбора.

Голос как интерфейс. Речь на входе и на выходе снимает необходимость печатать — критично для полевых сотрудников, водителей, производства.

Проверка по фото. Соответствие сборки чертежу, состояние объекта, комплектность отгрузки.

Разбор экрана. Пользователь присылает скриншот проблемы вместо описания.

Зачем фаундеру

Целый класс задач, ещё недавно требовавших отдельной разработки и обучения моделей, теперь решается запросом к готовому API. Это резко удешевляет проверку гипотез в отраслях, где данные существуют в виде фотографий и бумаг, — производство, логистика, стройка, ремонт.

Практический совет: прежде чем строить свой распознаватель, проверьте задачу на готовой мультимодальной модели. Часто этого достаточно.

Где ошибаются

Считают точность гарантированной. Модель уверенно ошибается в цифрах на плохом снимке — критичные значения нужно подтверждать.

Не считают стоимость. Изображения расходуют заметно больше токенов, чем кажется по объёму текста на них.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

LLM

Модель, обученная предсказывать следующий фрагмент текста и научившаяся на этом отвечать, писать код и рассуждать. Основа современных AI-продуктов.

Диффузионная модель

Модель, которая создаёт изображение, постепенно убирая шум по текстовому описанию. Технология за большинством генераторов картинок и видео.

Трансформер

Архитектура нейросетей с механизмом внимания, на которой построены сегодняшние языковые и мультимодальные модели. Появилась в 2017 году.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.