Разбор Qwen 3.8 27B: они удалили 75% механизма внимания
Автор: Cloud Codes
Загружено: 2026-08-16
Просмотров: 16853
Описание:
Почему Alibaba создала модель с 27 миллиардами параметров, в которой 48 из 64 слоев используют линейное внимание Gated DeltaNet вместо традиционного внимания трансформеров? Встречайте Qwen 3.8 27B и архитектурное соотношение 3:1, заменяющее трансформеры.
🔔 Подпишитесь: / @cloud-codes
💙 Станьте участником: / @cloud-codes
🐦 Twitter/X:
https://x.com/cloud_codes
💬 Discord:
/ discord
В этом подробном обзоре Cloud Codes разбирает архитектуру компьютера, линейную алгебру и арифметику кэш-памяти KV, лежащие в основе Qwen 3.8 27B Dense. Мы изучаем его 64-слойную гибридную структуру (48 слоев Gated DeltaNet и 16 слоев Gated Attention), анализируем, как обновление матрицы текущего состояния вместо хранения расширяющегося кэша ключ-значение сокращает объем памяти контекста токенов с 244 ГБ до 61 ГБ, и рассматриваем его открытые веса Apache 2.0.
Кроме того, мы проверяем опубликованные компанией результаты бенчмарков, показывающие, что Qwen 3.8 27B превосходит Claude Opus 4.6 Max в SWE-bench Pro (61,7 против 53,4) и OSWorld (84,3 против 72,7), выявляем 9-балльное поражение в Humanity's Last Exam (HLE), анализируем примечание к тестовой среде Claude Code, анализируем локальный запуск GGUF Саймона Уиллисона на MacBook Pro M5 Max с объемом памяти 17 ГБ и оцениваем, почему гибридные системы с линейным вниманием представляют собой будущее локального обслуживания LLM.
Если это помогло вам понять архитектуру бэкэнда, проектирование системы и как создавать более быстрое программное обеспечение, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый разбор инфраструктуры! Создавайте, решайте задачи, развертывайте.
🔗 Упомянутые репозитории и источники:
Официальная модель Qwen 3.8 27B:
https://huggingface.co/Qwen/Qwen3.8-27B
Unsloth Qwen 3.8 27B GGUF Quants:
https://huggingface.co/unsloth/Qwen3....
Статья об архитектуре Gated Delta Networks:
https://arxiv.org/abs/2412.06464
Движок вывода SGLang:
https://github.com/sgl-project/sglang
Hacker News — Обсуждение Qwen 3.8:
https://news.ycombinator.com/item?id=...
⏱️ Разделы видео:
0:00 - Архитектура 75% без трансформаторов
1:01 - «Стена памяти»: почему взрываются кэши типа «всё или ничего» с механизмом внимания
1:43 — Арифметика кэша «всё или ничего» 61 ГБ против 244 ГБ
3:07 — Что такое Gated DeltaNet? (Shoebox против Running Balance)
4:44 — Соотношение 3:1: чередование линейного внимания и полного внимания
5:20 — Бенчмарки: Qwen 27B против Claude Opus 4.6 Max
6:41 — В чём проигрывает Qwen: Terminal-Bench и HLE Reasoning
8:31 — Плотный 27-байтовый размер и спекулятивное декодирование MTP
9:47 — Примечание: Кто проводил эти бенчмарки?
11:19 - Локальное тестирование разработчиками: запуск GGUF Саймона Уиллисона на 17 ГБ
12:45 - Сдвиг архитектуры: Qwen 3.8 и Nemotron 3.5
13:47 - Окончательный вердикт: почему архитектура победила
#qwen #qwen38 #gateddeltanet #localai #systemdesign #cloudcodes #machinelearning #transformers #python #softwareengineering
Запросы пользователей:
qwen 3 8 27b architecture gated deltanet linear attention
why 75 percent of qwen 3 8 27b is not a transformer
qwen 3 8 27b 1m context kv cache 61gb vs 244gb
gated deltanet vs mamba 2 state space models
simon willison qwen 3 8 27b lm studio m5 max benchmark
qwen 3 8 27b swebench pro osworld vs claude opus
yarn factor 4 0 context extension qwen 3 8
multi token prediction mtp head qwen 3 8 27b
qwen 3 8 27b apache 2 0 open weights
cloud codes qwen 3 8 27b efficiency breakdown
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: