К содержимому
AI и данные

Трансформер — архитектура современных моделей

Архитектура нейросетей с механизмом внимания, на которой построены сегодняшние языковые и мультимодальные модели. Появилась в 2017 году.

Также встречается как: transformer, механизм внимания, attention

Коротко. Трансформер — архитектура нейросети, представленная в 2017 году в работе «Attention Is All You Need». Её главный элемент — механизм внимания, позволяющий модели при обработке каждого токена учитывать все остальные.

Почему это оказалось важно

Прежние архитектуры читали текст последовательно и плохо удерживали связи между удалёнными словами. Внимание решило обе проблемы: связи между любыми позициями устанавливаются напрямую, а вычисления хорошо распараллеливаются.

Параллельность и оказалась решающей: она позволила обучать модели на объёмах данных, недоступных прежним подходам. Всё, что называют современными AI-моделями, выросло отсюда.

Зачем фаундеру

Знать устройство не обязательно, но два следствия влияют на продукт:

Стоимость растёт быстрее длины текста. Внимание сравнивает токены попарно, поэтому длинный контекст дорожает нелинейно.

Модель обрабатывает текст целиком, а не последовательно. Отсюда её способность связывать начало и конец документа — и она же объясняет, почему порядок и структура промпта так сильно влияют на результат.

Где ошибаются

Считают трансформер синонимом LLM. Архитектура применяется и к изображениям, звуку и видео — языковые модели лишь самое известное применение.

Разобрать это на своём проекте

Мы доводим идеи фаундеров до работающего MVP за долю в компании. Расскажите про свою — посмотрим на цифры вместе.

Оставить заявку

Рядом в словаре

Нейросеть

Модель из множества простых элементов со связями, чьи веса подбираются при обучении. Технология, на которой построены современные AI-системы.

LLM

Модель, обученная предсказывать следующий фрагмент текста и научившаяся на этом отвечать, писать код и рассуждать. Основа современных AI-продуктов.

Токен

Кусочек текста, которым оперирует языковая модель: часть слова, слово или знак. В токенах измеряют и лимиты контекста, и стоимость запросов.

Векторная база

База данных, которая хранит векторы и быстро находит ближайшие к запросу. Инфраструктурный слой поиска по смыслу и RAG-систем.

Галлюцинация

Правдоподобный, но неверный ответ модели: несуществующие факты, ссылки и цитаты. Свойство технологии, а не поломка, — с ним работают, а не чинят.

Дистилляция

Обучение компактной модели на ответах крупной, чтобы получить близкое качество на узкой задаче за меньшие деньги и с меньшей задержкой.