ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Разбор Qwen 3.8 27B: они удалили 75% механизма внимания

qwen

qwen 3 8

27b model

gated deltanet

linear attention

transformers

kv cache

local ai

alibaba

cloud codes

python

machine learning

artificial intelligence

gguf

sf

silicon valley

qwen 3.8

qwen 3.8 27b

qwen 3.8 max

qwen 3.8 27b test

qwen 3.8 27b coding

qwen 3.8 27b locally

qwen 3.8 27b mac

qwen 3.8 27b on 8gb vram

qwen 3.8 27b setup

qwen 3.8 27b 5090

qwen 3.8 27b ollama

qwen 3.8 27b local

qwen 3.8 27b benchmark

qwen 3.8 27b api

qwen 3.8 27b vllm

Автор: Cloud Codes

Загружено: 2026-08-16

Просмотров: 16853

Описание: Почему Alibaba создала модель с 27 миллиардами параметров, в которой 48 из 64 слоев используют линейное внимание Gated DeltaNet вместо традиционного внимания трансформеров? Встречайте Qwen 3.8 27B и архитектурное соотношение 3:1, заменяющее трансформеры.

🔔 Подпишитесь:    / @cloud-codes  

💙 Станьте участником:    / @cloud-codes  

🐦 Twitter/X:

https://x.com/cloud_codes

💬 Discord:
  / discord  

В этом подробном обзоре Cloud Codes разбирает архитектуру компьютера, линейную алгебру и арифметику кэш-памяти KV, лежащие в основе Qwen 3.8 27B Dense. Мы изучаем его 64-слойную гибридную структуру (48 слоев Gated DeltaNet и 16 слоев Gated Attention), анализируем, как обновление матрицы текущего состояния вместо хранения расширяющегося кэша ключ-значение сокращает объем памяти контекста токенов с 244 ГБ до 61 ГБ, и рассматриваем его открытые веса Apache 2.0.

Кроме того, мы проверяем опубликованные компанией результаты бенчмарков, показывающие, что Qwen 3.8 27B превосходит Claude Opus 4.6 Max в SWE-bench Pro (61,7 против 53,4) и OSWorld (84,3 против 72,7), выявляем 9-балльное поражение в Humanity's Last Exam (HLE), анализируем примечание к тестовой среде Claude Code, анализируем локальный запуск GGUF Саймона Уиллисона на MacBook Pro M5 Max с объемом памяти 17 ГБ и оцениваем, почему гибридные системы с линейным вниманием представляют собой будущее локального обслуживания LLM.

Если это помогло вам понять архитектуру бэкэнда, проектирование системы и как создавать более быстрое программное обеспечение, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый разбор инфраструктуры! Создавайте, решайте задачи, развертывайте.

🔗 Упомянутые репозитории и источники:
Официальная модель Qwen 3.8 27B:
https://huggingface.co/Qwen/Qwen3.8-27B

Unsloth Qwen 3.8 27B GGUF Quants:
https://huggingface.co/unsloth/Qwen3....

Статья об архитектуре Gated Delta Networks:
https://arxiv.org/abs/2412.06464

Движок вывода SGLang:
https://github.com/sgl-project/sglang

Hacker News — Обсуждение Qwen 3.8:
https://news.ycombinator.com/item?id=...

⏱️ Разделы видео:
0:00 - Архитектура 75% без трансформаторов
1:01 - «Стена памяти»: почему взрываются кэши типа «всё или ничего» с механизмом внимания
1:43 — Арифметика кэша «всё или ничего» 61 ГБ против 244 ГБ
3:07 — Что такое Gated DeltaNet? (Shoebox против Running Balance)
4:44 — Соотношение 3:1: чередование линейного внимания и полного внимания
5:20 — Бенчмарки: Qwen 27B против Claude Opus 4.6 Max
6:41 — В чём проигрывает Qwen: Terminal-Bench и HLE Reasoning
8:31 — Плотный 27-байтовый размер и спекулятивное декодирование MTP
9:47 — Примечание: Кто проводил эти бенчмарки?

11:19 - Локальное тестирование разработчиками: запуск GGUF Саймона Уиллисона на 17 ГБ
12:45 - Сдвиг архитектуры: Qwen 3.8 и Nemotron 3.5
13:47 - Окончательный вердикт: почему архитектура победила

#qwen #qwen38 #gateddeltanet #localai #systemdesign #cloudcodes #machinelearning #transformers #python #softwareengineering

Запросы пользователей:
qwen 3 8 27b architecture gated deltanet linear attention
why 75 percent of qwen 3 8 27b is not a transformer
qwen 3 8 27b 1m context kv cache 61gb vs 244gb
gated deltanet vs mamba 2 state space models
simon willison qwen 3 8 27b lm studio m5 max benchmark
qwen 3 8 27b swebench pro osworld vs claude opus
yarn factor 4 0 context extension qwen 3 8
multi token prediction mtp head qwen 3 8 27b
qwen 3 8 27b apache 2 0 open weights
cloud codes qwen 3 8 27b efficiency breakdown

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Разбор Qwen 3.8 27B: они удалили 75% механизма внимания

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]