Конструктор архитектуры ИИ
Соберите нейросеть из современных блоков — MoE-эксперты, GQA/MLA-внимание, RoPE, Mamba-слои, мультимодальные входы, хуки в середину модели. Конструктор считает параметры, память и бюджет обучения на лету; реальная LLM проводит экспертизу и «оживляет» проект; PyTorch-скелет экспортируется одним файлом.
Начать с заготовки
Готовые рецепты — форкайте и переделывайте под свою задачу.
Llama-подобный 8B
Современный базовый рецепт: GQA + SwiGLU + RoPE + pre-RMSNorm.
открыть в конструкторе →
GPT-2 small (124M)
Историческая классика 2019 года — почувствуйте разницу с Llama.
открыть в конструкторе →
MoE как Mixtral (47B/13B)
Mixture of Experts: 8 экспертов, активны 2 — качество 47B за скоростью 13B.
открыть в конструкторе →
Компактный MoE (1.5B/0.4B)
Тонкий MoE на маленьком d: дёшево в обучении, широкий охват задач.
открыть в конструкторе →
Гибрид внимание+SSM
Чередование attention и Mamba-слоёв (идея Jamba): длинный контекст дешевле.
открыть в конструкторе →
Мультимодальный (LLaVA-стиль)
Картинка → патчи → проекция в пространство текста: одна модель видит и говорит.
открыть в конструкторе →
ViT-энкодер
Vision Transformer: картинка = последовательность патчей, BERT-стиль.
открыть в конструкторе →
Диффузия DiT
Трансформер, который генерирует: время-эмбеддинг + adaLN, выход — шум патчей.
открыть в конструкторе →
Крошка для края (~40M)
Модель для телефона/микроконтроллера: словарь поменьше, MQA, тонкий FFN.
открыть в конструкторе →
Мои проекты
Пока ни одной архитектуры
Возьмите заготовку выше или соберите с нуля — черновики сохраняются и без регистрации (в вашем браузере), вход нужен только для LLM-экспертизы и симуляции.
Зоопарк: как устроены известные модели
Справочные данные из публикаций — для сравнения со своим проектом (конструктор показывает «× ближайший аналог»).
| Модель | Семейство | Параметров | Активных | Что важно |
|---|---|---|---|---|
| GPT-2 small | decoder | 124M | 124M | Классика-2019: MHA + GELU-FFN, learned pos |
| GPT-3 | decoder | 175B | 175B | 175B, масштабирование законов Кэплана |
| Llama-3-8B | decoder | 8.03B | 8.03B | GQA, SwiGLU, RoPE, RMSNorm — современный базовый рецепт |
| Llama-3-70B | decoder | 70.6B | 70.6B | Тот же рецепт, d=8192 |
| Mixtral-8x7B | decoder | 46.7B | 12.9B | MoE: 8 экспертов, top-2 — 13B активных из 47B |
| DeepSeek-V3 | decoder | 671B | 37B | MLA + тонкий MoE (256 экспертов, top-8): 671B тотал / 37B активных |
| Mamba-2.8B | ssm | 2.78B | 2.78B | SSM вместо внимания: линейно по длине |
| ViT-L/14 | encoder | 305M | 305M | Vision-башня CLIP: патчи 14×14 |
| CLIP ViT-L | dual | 435M | 435M | Две башни + contrastive loss |
| DiT-XL/2 | diffusion | 675M | 675M | Трансформер-диффузия (основа SD3/Flux) |
| Whisper-large-v3 | encoder-decoder | 1.55B | 1.55B | Аудио→текст: mel-энкодер + декодер |
| Chameleon-34B | decoder | 34B | 34B | Early fusion: один токен-поток для текста и картинок |
Активные параметры — сколько «работает» на один проход (у MoE меньше полного размера). Числа — из карточек моделей, для ориентира.