Российский GigaChat 3.5 Ultra

Выкатили open-source 432B-модель модель под MIT-лицензией. Это первый в open-source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров. Модель улучшили в коде, математике и агентных задачах: — Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой; — Gated Attention, модель может локально приглушать слишком сильный сигнал из attention-слоя; GatedNorm, нормализация с явным гейтом для управления масштабом сигнала между признаками; — Линейный слой требует в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%; — Две MTP-головы и ускорение генерации до 2,2 раза; — FP8 на всех этапах обучения без потери качества относительно bf16, свои Triton- и CUDA-ядра; — Новый этап online RL после SFT и DPO. Поддержать проект - https://boosty.to/futuristica/donate

Иконка канала fутуристика
3 подписчика
12+
8 просмотров
2 дня назад
12+
8 просмотров
2 дня назад

Выкатили open-source 432B-модель модель под MIT-лицензией. Это первый в open-source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров. Модель улучшили в коде, математике и агентных задачах: — Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой; — Gated Attention, модель может локально приглушать слишком сильный сигнал из attention-слоя; GatedNorm, нормализация с явным гейтом для управления масштабом сигнала между признаками; — Линейный слой требует в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%; — Две MTP-головы и ускорение генерации до 2,2 раза; — FP8 на всех этапах обучения без потери качества относительно bf16, свои Triton- и CUDA-ядра; — Новый этап online RL после SFT и DPO. Поддержать проект - https://boosty.to/futuristica/donate

, чтобы оставлять комментарии