Введите корпус, обучите учебную модель и посмотрите, как из токенов получаются вероятности следующего слова.
Модель еще не обучена. Нажмите "Обучить модель".
Толщина линий в блоке attention показывает среднее внимание между токенами текущего контекста.
Строка - текущий токен, столбец - токен, на который он смотрит. Более темная ячейка означает больший вес внимания.
В этой учебной визуализации "нейрон" слоя показан не как каждый элемент вектора, а как токен-вектор целиком. То есть один кружок = один токен со своим вектором размерности "Размер вектора", а не отдельные v1, v2, v3...
Расчет показывает учебную оценку для чисел Float64 в JavaScript: 8 байт на число. Реальный браузер тратит больше из-за объектов, массивов и служебных структур.
Эта вкладка показывает обучаемые веса учебной модели: матрицу logits для перехода "текущий токен -> следующий токен". Attention на вкладке "Слои" вычисляется во время прохода по тексту, а эти веса меняются именно при обучении.
Этот инструмент создан как наглядная модель большой языковой модели. Он не подключает внешние нейросети и не отправляет текст на сервер: обучение и генерация выполняются прямо в браузере. Сервис показывает ключевые части Transformer: токенизацию, словарь, эмбеддинги, позиционные признаки, несколько голов внимания, feed-forward слой, вероятности следующего токена и пошаговую генерацию.
В настоящих LLM миллиарды параметров обучаются на огромных корпусах. Здесь используется маленькая учебная модель: она строит словарь по введенному корпусу, создает числовые векторы токенов и обучает матрицу переходов следующего токена методом градиентного шага по ошибке softmax. Это упрощение, но оно сохраняет главный принцип: модель получает предыдущие токены и вычисляет распределение вероятностей для следующего токена.
Визуализация attention показывает, на какие слова текущий токен обращает больше внимания. Несколько голов внимания могут подсвечивать разные связи: одна голова сильнее реагирует на близкие слова, другая - на похожие числовые векторы, третья - на повторяющиеся токены и структуру контекста. Карточки слоев показывают, как данные проходят через Transformer: входные векторы смешиваются attention, затем отдельно перерабатываются feed-forward блоком.
Настройки позволяют менять число слоев, голов внимания, размер вектора, скорость обучения, количество эпох, температуру генерации и длину ответа. При низкой температуре модель выбирает более вероятные продолжения, при высокой - чаще пробует редкие варианты. Поэтому пользователь может увидеть, что LLM не хранит готовый ответ, а каждый раз выбирает следующий токен по вероятностям.
Сервис полезен для студентов и начинающих разработчиков: он объясняет, почему порядок слов важен, зачем нужны векторы, как attention связывает токены между собой, что означает обучение по ошибке и почему генерация текста является повторяющимся выбором следующего токена.
Комментарии