Вход

Конструктор архитектуры ИИ

Соберите нейросеть из современных блоков — MoE-эксперты, GQA/MLA-внимание, RoPE, Mamba-слои, мультимодальные входы, хуки в середину модели. Конструктор считает параметры, память и бюджет обучения на лету; реальная LLM проводит экспертизу и «оживляет» проект; PyTorch-скелет экспортируется одним файлом.

Новая архитектура

Начать с заготовки

Готовые рецепты — форкайте и переделывайте под свою задачу.

Llama-подобный 8B

Современный базовый рецепт: GQA + SwiGLU + RoPE + pre-RMSNorm.

открыть в конструкторе →

GPT-2 small (124M)

Историческая классика 2019 года — почувствуйте разницу с Llama.

открыть в конструкторе →

MoE как Mixtral (47B/13B)

Mixture of Experts: 8 экспертов, активны 2 — качество 47B за скоростью 13B.

открыть в конструкторе →

Компактный MoE (1.5B/0.4B)

Тонкий MoE на маленьком d: дёшево в обучении, широкий охват задач.

открыть в конструкторе →

Гибрид внимание+SSM

Чередование attention и Mamba-слоёв (идея Jamba): длинный контекст дешевле.

открыть в конструкторе →

Мультимодальный (LLaVA-стиль)

Картинка → патчи → проекция в пространство текста: одна модель видит и говорит.

открыть в конструкторе →

ViT-энкодер

Vision Transformer: картинка = последовательность патчей, BERT-стиль.

открыть в конструкторе →

Диффузия DiT

Трансформер, который генерирует: время-эмбеддинг + adaLN, выход — шум патчей.

открыть в конструкторе →

Крошка для края (~40M)

Модель для телефона/микроконтроллера: словарь поменьше, MQA, тонкий FFN.

открыть в конструкторе →

Мои проекты

Пока ни одной архитектуры

Возьмите заготовку выше или соберите с нуля — черновики сохраняются и без регистрации (в вашем браузере), вход нужен только для LLM-экспертизы и симуляции.

Зоопарк: как устроены известные модели

Справочные данные из публикаций — для сравнения со своим проектом (конструктор показывает «× ближайший аналог»).

Модель Семейство Параметров Активных
GPT-2 small decoder 124M 124M
GPT-3 decoder 175B 175B
Llama-3-8B decoder 8.03B 8.03B
Llama-3-70B decoder 70.6B 70.6B
Mixtral-8x7B decoder 46.7B 12.9B
DeepSeek-V3 decoder 671B 37B
Mamba-2.8B ssm 2.78B 2.78B
ViT-L/14 encoder 305M 305M
CLIP ViT-L dual 435M 435M
DiT-XL/2 diffusion 675M 675M
Whisper-large-v3 encoder-decoder 1.55B 1.55B
Chameleon-34B decoder 34B 34B

Активные параметры — сколько «работает» на один проход (у MoE меньше полного размера). Числа — из карточек моделей, для ориентира.