Трансформер — архитектура современных моделей
Архитектура нейросетей с механизмом внимания, на которой построены сегодняшние языковые и мультимодальные модели. Появилась в 2017 году.
Также встречается как: transformer, механизм внимания, attention
Коротко. Трансформер — архитектура нейросети, представленная в 2017 году в работе «Attention Is All You Need». Её главный элемент — механизм внимания, позволяющий модели при обработке каждого токена учитывать все остальные.
Почему это оказалось важно
Прежние архитектуры читали текст последовательно и плохо удерживали связи между удалёнными словами. Внимание решило обе проблемы: связи между любыми позициями устанавливаются напрямую, а вычисления хорошо распараллеливаются.
Параллельность и оказалась решающей: она позволила обучать модели на объёмах данных, недоступных прежним подходам. Всё, что называют современными AI-моделями, выросло отсюда.
Зачем фаундеру
Знать устройство не обязательно, но два следствия влияют на продукт:
Стоимость растёт быстрее длины текста. Внимание сравнивает токены попарно, поэтому длинный контекст дорожает нелинейно.
Модель обрабатывает текст целиком, а не последовательно. Отсюда её способность связывать начало и конец документа — и она же объясняет, почему порядок и структура промпта так сильно влияют на результат.
Где ошибаются
Считают трансформер синонимом LLM. Архитектура применяется и к изображениям, звуку и видео — языковые модели лишь самое известное применение.
Разобрать это на своём проекте
Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.