Лаборатория LLM
Пять демонстраций того, как языковая модель видит текст и выбирает следующий токен. Часть работает на наших глазах без внешнего ИИ, часть — на нашей базе знаний, которая растёт от каждого посетителя. Всё честно: где стоит оценка, а не измерение, — написано.
Как режет мини-BPE
Это упрощённый токенизатор, обученный на нашем корпусе: знакомые слова и частые части слов — один токен, редкие дробятся. Так видно главное: цена текста зависит от словаря модели, а не только от длины.
Из чего сложилась оценка
Оценка по типам символов для реальных моделей (русский текст дороже латиницы: кириллица дробится мельче). Точный подсчёт даёт только токенизатор конкретной модели.
Сколько стоит этот текст
Вход — ваш текст, выход — ответ примерно на 400 токенов. Прайс ориентировочный (сверен 01.10.2026), локальная модель бесплатна: считаем электричество, а не токены.
Распределение вероятностей
Здесь работает не нейросеть, а n-граммная модель платформы: она показывает те же принципы выбора (распределение, температура, top-k и top-p), но проще и полностью объяснима.
Игра: угадайте токен, который выберет модель
Модель играет детерминированно: один и тот же контекст — один и тот же токен. Посмотрим, совпадёт ли ваш выбор.
Обучить модель своим текстом
Добавьте абзац — после модерации он попадёт в n-граммы и словарь мини-BPE, и продолжения станут богаче. Тексты без ваших персональных данных: мы храним только сам текст и метку браузера.
Близость по смыслу
Эмбеддинг превращает текст в вектор. Похожие по смыслу тексты дают близкие векторы — даже без общих слов. Если на платформе подключён сервер эмбеддингов, считаем им; иначе — локальным хешем символьных n-грамм.
Семантическая карта базы
накоплено точек: 12Разбор промпта по чек-листу
Детерминированная проверка: роль, задача, контекст, формат, ограничения, примеры. Без ИИ — по правилам, поэтому одинаковый промпт всегда получает одинаковый разбор.
Прогон на реальной модели
Опишите задачу и дайте два варианта промпта — модель ответит на оба, и вы увидите разницу. Прогоны уходят в очередь и хранятся в базе (без ваших персональных данных).
Библиотека промптов
Шаблоны проверены на практике; голоса показывают, что работает у посетителей. Свой промпт можно добавить — лучшие поднимаются вверх.
Ты — опытный {специалист} с 20-летним стажем. Разбери ситуацию ниже как практик: что здесь главное, какие есть риски и что бы ты сделал в первую очередь. Отвечай по-русски, структура: «Главное», «Риски», «Что делать». Ситуация: {текст}
Сожми текст ниже до {N} предложений. Сохрани все числа, даты и имена. Не добавляй того, чего нет в тексте. Если чего-то не хватает для понимания, напиши «в тексте не сказано». Текст: {текст}
Извлеки данные из текста строго в JSON по схеме: {"компания": "", "сумма": null, "срок": "", "предмет": ""}. Правила: бери только то, что есть в тексте; неизвестное оставляй пустой строкой или null; верни только JSON, без пояснений. Текст: {текст}
Отнеси обращение к одной из рубрик: «жалоба», «вопрос», «предложение», «спам». Ответь строго в формате: рубрика | уверенность 0–1 | одна фраза-обоснование. Если непонятно — рубрика «вопрос», уверенность 0.3. Обращение: {текст}
Приведи заголовок к единому виду. Примеры: «купил ноутбук за 50 тысяч» → «Ноутбук — 50 000 ₽»; «ремонт квартиры 120000 р.» → «Ремонт квартиры — 120 000 ₽». Теперь обработай: {текст}
Реши задачу по шагам. Сначала перечисли известные данные, затем выполни вычисления по одному действию в строке, в конце дай короткий итоговый ответ. Если данных не хватает — скажи, каких именно. Задача: {текст}
Ответь на вопрос, затем проверь себя: перечисли 2–3 места, где ты можешь ошибаться, и укажи, что нужно проверить по первоисточнику. В конце дай окончательный ответ с пометкой уверенности (высокая/средняя/низкая). Вопрос: {текст}
Перепиши текст для аудитории «{аудитория}». Сохрани смысл и факты, убери канцелярит, сократи на треть. Не добавляй новых фактов и не меняй цифры. Текст: {текст}
Составь план достижения цели: {цель}. Формат: этап — результат — срок — что может пойти не так. Не более 7 этапов. Если цель сформулирована нечётко, сначала задай 3 уточняющих вопроса.
Разбери текст как строгий редактор: 3 сильные стороны, 3 слабые, конкретные правки построчно. Не переписывай текст целиком, пока не объяснил, что и почему меняешь. Текст: {текст}
Перепиши сообщение в тоне «{тон}». Правила: короткие предложения, без восклицаний, одно действие в конце. Не меняй факты. Сообщение: {текст}
Ответь на вопрос, опираясь ТОЛЬКО на фрагменты ниже. После каждого утверждения укажи номер источника в квадратных скобках. Если ответа во фрагментах нет — напиши «в источниках нет данных». Вопрос: {вопрос}. Фрагменты: {фрагменты}
Оцени текст на риски: персональные данные, медицинские или юридические утверждения, манипуляции. Формат: риск — где именно — что сделать. Если рисков нет, ответь «рисков не найдено». Текст: {текст}
Объясни понятие «{термин}» человеку без технического образования: сначала одна фраза-определение, затем аналогия из быта, затем пример и одна ловушка, в которую попадают новички. Без жаргона.
Сравни варианты: {варианты}. Формат — таблица из трёх колонок: критерий, чем отличаются, кому подходит. В конце — рекомендация с одной оговоркой. Если данных мало, честно скажи.
Ты — инженер промптов. Разбери мой промпт: что в нём неоднозначного, чего не хватает для стабильного результата, какие части противоречат друг другу. Затем дай улучшенную версию с ролью, форматом и ограничениями. Мой промпт: {текст}
Квиз: проверьте себя
Пять терминов, четыре варианта определения. Ответы анонимно копятся в базе: видно, какие понятия путают чаще всего.
Что путают чаще всего
- вместо «RAG» выбирают «Внимание (attention)» 1×
- вместо «Дистилляция» выбирают «LoRA» 1×
- вместо «Контекстное окно» выбирают «Токенизатор» 1×
- вместо «Токенизатор» выбирают «Chain-of-Thought» 1×
Где модель удивляет людей
Ещё мало попыток — сыграйте во вкладке «Следующий токен».
Глоссарий
46 терминов с пояснениями и источниками. Термины засеяны конфигом, дальше база живёт сама.
Чанкинг rag · 2/3
Разбиение документов на фрагменты для поиска и подачи в модель.
Слишком крупный фрагмент тратит контекст, слишком мелкий теряет смысл. Обычно режут по абзацам или смысловым блокам, иногда с перекрытием.
Источник: Практика RAG
Реранкер rag · 3/3
Вторая модель, которая пересортировывает найденные фрагменты по релевантности.
Поиск быстро достаёт десятки кандидатов, реранкер точнее выбирает лучшие. Заметно улучшает качество RAG при небольшой цене.
Источник: Практика RAG
Агент агенты · 2/3
Модель, которая сама планирует шаги и вызывает инструменты для достижения цели.
Ключевое отличие от чата — действие: поиск, база, отправка письма. Агенту нужны лимиты шагов, журнал действий и проверка прав.
Источник: Практика LLM-агентов
Вызов инструментов агенты · 2/3
Механизм, через который модель просит выполнить функцию в вашем коде.
Модель возвращает имя функции и аргументы, код выполняет действие и отдаёт результат обратно. Модель никогда не выполняет код сама — решение остаётся за программой.
Источник: Документация провайдеров
MCP агенты · 3/3
Открытый протокол, по которому модель получает доступ к инструментам и данным.
Унифицирует подключение сервисов к ИИ-клиентам: один раз описали сервер — пользуетесь из разных приложений.
Источник: Спецификация MCP
RAG архитектура · 2/3 верно 0 из 1
Дополнение генерации поиском: нужные фрагменты находят и подкладывают в промпт.
Схема: вопрос → поиск (часто векторный) → фрагменты → ответ со ссылками на источники. Уменьшает выдумки и позволяет не переобучать модель при обновлении данных.
Источник: Lewis и др. (2020)
Трансформер архитектура · 2/3
Архитектура нейросети, на которой построены современные языковые модели.
Ключевой механизм — внимание: каждый токен «смотрит» на другие и собирает контекст. Из-за квадратичной сложности внимания длинный контекст дорог по вычислениям.
Источник: Vaswani и др. (2017)
MoE (смесь экспертов) архитектура · 3/3
Архитектура, где на каждый токен работают лишь несколько «экспертных» подсетей.
Позволяет держать очень большую модель при умеренных вычислениях: активна только часть параметров. Требует больше памяти, чем плотная модель того же качества.
Источник: Shazeer и др. (2017)
Внимание (attention) архитектура · 3/3
Механизм, который решает, на какие части входа опираться при обработке каждого токена.
Внимание не объясняет решение целиком: карты внимания показывают, куда модель смотрела, но не почему. Это популярная, но не полная интерпретация.
Источник: Vaswani и др. (2017)
Косинусная близость векторы · 1/3
Мера похожести двух векторов: косинус угла между ними, от −1 до 1.
Единица — направления совпадают, ноль — векторы перпендикулярны. В семантическом поиске обычно сравнивают именно косинус, а не длину вектора, чтобы не зависеть от размера текста.
Источник: Стандартное определение
Эмбеддинг векторы · 1/3
Вектор чисел, описывающий смысл текста, изображения или другого объекта.
Похожие по смыслу тексты получают близкие векторы. Эмбеддинги применяют для поиска, кластеризации, рекомендаций и дедупликации. Это не «понимание», а сжатое отражение закономерностей обучающих данных.
Источник: RAG-практика, документация embedding-моделей
Векторная база векторы · 2/3
Хранилище векторов с быстрым поиском ближайших соседей.
Индекс (HNSW, IVF) позволяет искать среди миллионов векторов за миллисекунды. В PostgreSQL такую роль играет расширение pgvector.
Источник: Практика векторных баз
Семантический поиск векторы · 2/3 верно 1 из 1
Поиск по смыслу, а не по совпадению слов.
Запрос и документы переводят в векторы и ищут ближайшие. Находит «машина» по запросу «автомобиль», но может ошибиться на отрицаниях: «не работает» и «работает» часто оказываются близко.
Источник: Практика векторных баз
Сэмплирование генерация · 1/3 верно 1 из 1
Случайный выбор следующего токена по распределению вероятностей.
Именно поэтому один и тот же промпт даёт разные ответы. При temperature=0 выбор детерминированный (жадный, greedy).
Источник: Устройство инференса
Температура генерация · 1/3
Параметр случайности выбора следующего токена.
Низкая температура (0–0.3) — почти всегда самый вероятный токен: ответы устойчивы и предсказуемы. Высокая (0.8–1.2) — редкие варианты получают шанс: текст разнообразнее, но растёт риск ошибок.
Источник: Документация провайдеров
Top-k генерация · 2/3
Ограничение выбора k самыми вероятными токенами.
Топ-k отсекает длинный хвост редких токенов до розыгрыша. k=1 означает «всегда лучший токен», k=50 оставляет 50 кандидатов.
Источник: Документация провайдеров
Top-p (nucleus) генерация · 2/3
Выбор из минимального набора токенов, чья суммарная вероятность ≥ p.
При p=0.9 в выборке остаются токены, которые вместе дают 90 % вероятности. В отличие от top-k, размер набора меняется: на уверенном шаге останется один токен, на спорном — много.
Источник: Holtzman и др. (2019)
Детерминизм при T=0 генерация · 2/3
При нулевой температуре выбор всегда падает на самый вероятный токен.
Ответ кажется воспроизводимым, но абсолютной гарантии нет: порядок операций на GPU, батчи и версия модели могут менять результат.
Источник: Практика инференса
Жадная генерация генерация · 2/3
Выбор самого вероятного токена на каждом шаге без случайности.
Даёт самый предсказуемый результат, но не «лучший ответ в целом»: локально лучший шаг может привести к плохому тексту.
Источник: Устройство инференса
Инференс инференс · 1/3
Режим работы модели, когда она отвечает, а не обучается.
Инференс считает токены по одному. Отсюда метрики: сколько токенов в секунду выдаёт сервер и сколько ждать первого токена.
Источник: Практика LLM-сервисов
Задержка ответа инференс · 2/3
Сколько времени проходит до первого токена и до полного ответа.
Зависит от размера промпта, модели и загрузки сервера. Для интерфейсов важна задержка первого токена: она ощущается как «скорость» сервиса.
Источник: Практика LLM-сервисов
Квантизация инференс · 2/3
Сжатие весов модели до 8 или 4 бит вместо 16.
Уменьшает память и ускоряет работу, немного теряя качество. Позволяет запускать модели на обычной видеокарте или даже на процессоре.
Источник: Практика локального запуска
KV-кэш инференс · 3/3
Сохранённые промежуточные состояния внимания, чтобы не пересчитывать весь контекст на каждом шаге.
Ускоряет генерацию, но занимает память: длинный контекст и много параллельных запросов быстро съедают VRAM.
Источник: Практика инференса
Softmax математика · 2/3
Функция, превращающая произвольные числа (логиты) в вероятности.
Экспонента выравнивает разницу: больше логит — заметно больше вероятность. Сумма всех вероятностей после softmax равна единице.
Источник: Стандартное определение
Энтропия математика · 2/3
Мера неопределённости распределения вероятностей, в битах.
Высокая энтропия — модель не уверена, вариантов много. Низкая — почти однозначный выбор. По энтропии видно, где модель «думает», а где просто продолжает шаблон.
Источник: Теория информации, Шеннон
Логиты математика · 3/3
Сырые оценки модели для каждого токена словаря до превращения в вероятности.
Модель выдаёт по числу на каждый токен словаря. Затем softmax делает из них распределение, из которого выбирается следующий токен. Логиты можно сравнивать между собой, но их абсолютные значения не имеют смысла.
Источник: Устройство языковых моделей
Дообучение обучение · 2/3
Настройка модели на своих данных под конкретную задачу.
Нужно, когда промпта и поиска не хватает: важен устойчивый стиль или своя терминология. Требует данных, денег и проверки, что модель не разучилась на других задачах.
Источник: Практика ML
LoRA обучение · 3/3
Лёгкое дообучение: обучают небольшие добавки к весам, а не всю модель.
Экономит память и время. Адаптер можно хранить отдельно и подключать к базовой модели под конкретную задачу.
Источник: Hu и др. (2021)
RLHF обучение · 3/3
Обучение с подкреплением по отзывам людей: ответы оценивают и настраивают модель на «хорошие».
Так модель учат быть полезной и безопасной. Оценки людей субъективны, поэтому модель наследует их предпочтения и предрассудки.
Источник: Christiano и др. (2017)
Дистилляция обучение · 3/3 верно 0 из 1
Перенос знаний большой модели в маленькую.
Малая модель учится повторять ответы большой и становится дешевле в работе. Часть качества при этом теряется, особенно на редких задачах.
Источник: Hinton и др. (2015)
Контекстное окно основы · 1/3 верно 0 из 1
Сколько токенов модель может обработать в одном запросе, включая промпт и ответ.
Всё, что не поместилось в окно, модель не видит. Большое окно не значит «помнит всё»: внимание к середине длинного текста слабее, чем к началу и концу.
Источник: Документация провайдеров
Токен основы · 1/3
Кусочек текста, которым оперирует модель: слово, часть слова, знак или пробел.
Модель не видит буквы и слова напрямую — она работает с токенами. «Привет» может быть одним токеном, а «токенизация» — четырьмя. Цена запроса считается в токенах, поэтому редкие слова и длинные числа обходятся дороже.
Источник: OpenAI Tokenizer; документация моделей
Токенизатор основы · 1/3 верно 0 из 1
Алгоритм, который режет текст на токены по заранее собранному словарю.
Чаще всего это BPE: частые куски текста становятся отдельными токенами, редкие дробятся на части. У каждой модели свой словарь, поэтому один и тот же текст в разных моделях стоит разного числа токенов.
Источник: Sennrich и др., BPE (2016)
Стоимость токенов оценка · 1/3
Цена запроса: входные и выходные токены считаются по своему тарифу.
Выход обычно в 3–5 раз дороже входа. Экономия: короче промпт, меньше лишних документов в контексте, кэш повторяющихся частей.
Источник: Прайсы провайдеров
Оценка качества оценка · 2/3
Измерение того, насколько хорошо система решает реальные задачи.
Нужен набор задач с ожидаемыми ответами или критериями. Без него улучшения — вопрос вкуса, а «стало лучше» — недоказуемо.
Источник: Практика LLM-разработки
Слепое сравнение оценка · 2/3
Сравнение двух ответов без подписи, какая модель или промпт их сделали.
Человек выбирает лучший, голоса накапливаются — так строится рейтинг. Оценка субъективна, зато отражает реальные предпочтения.
Источник: Практика LLM-арен
Перплексия оценка · 3/3
Мера «удивления» модели на тексте: чем меньше, тем лучше она предсказывает.
Формально — экспонента средней отрицательной логарифмической вероятности. Перплексию нельзя сравнивать между разными токенизаторами напрямую.
Источник: Стандарт оценки языковых моделей
Few-shot промпты · 1/3
Приём: дать модели несколько примеров «вход → выход» прямо в промпте.
Примеры задают формат надёжнее любых словесных описаний. Zero-shot — без примеров, one-shot — с одним.
Источник: Brown и др. (2020)
Промпт промпты · 1/3
Задание, которое получает модель: что сделать и в каком виде вернуть результат.
Хороший промпт содержит роль, задачу, контекст, ограничения, формат и примеры. Это техническое задание, а не вопрос в чате.
Источник: Практика промптинга
Chain-of-Thought промпты · 2/3
Просьба рассуждать по шагам перед ответом.
Пошаговое рассуждение помогает на задачах с вычислениями и логикой. Важно: рассуждения модели — не гарантия правильности, а лишь более удобный для неё способ считать.
Источник: Wei и др. (2022)
Системный промпт промпты · 2/3
Инструкция, которая задаёт роль и правила модели на весь диалог.
Стоит выше пользовательских сообщений по приоритету. В него кладут стиль, запреты и формат. Секреты в системный промпт не кладут: его можно вытащить вопросами.
Источник: Документация провайдеров
Строгий JSON промпты · 2/3 верно 1 из 1
Требование вернуть ответ строго в формате JSON по заданной схеме.
Нужен, когда результат читает программа. Надёжность повышают: схемой в промпте, низкой температурой и проверкой ответа перед использованием. Модель может добавить пояснение вокруг JSON — его срезают.
Источник: Практика интеграций
Галлюцинация риски · 1/3
Правдоподобный, но неверный ответ модели.
Модель продолжает текст, а не сверяется с фактами. Особенно часто выдумываются числа, даты, цитаты и ссылки. Лечение: источники в промпте, требование «нет данных», проверка фактов человеком.
Источник: Практика применения LLM
Guardrails риски · 2/3
Внешние правила и фильтры вокруг модели: что можно на входе и выходе.
Модель — не последняя линия защиты. Проверка формата, фильтр тем, лимиты прав и человек в контуре надёжнее уговоров «не делай так».
Источник: Практика применения LLM
Jailbreak риски · 2/3
Обход ограничений модели через хитро сформулированный запрос.
Модели обучают отказываться от опасных просьб, но находить обход можно бесконечно. Надёжнее технические запреты: не давать модели реальных возможностей, которые не должны быть доступны.
Источник: Практика безопасности LLM
Промпт-инъекция риски · 2/3
Попытка через текст заставить модель нарушить инструкции.
Опасна в агентах: вредоносный текст в веб-странице может попросить «отправить данные» или «вызвать инструмент». Защита — не давать агенту прав больше нужного и проверять действия.
Источник: OWASP LLM Top-10