Запуск Kimi K3 на 8 ГБ ОЗУ (без GPU)
Автор: Cloud Codes
Загружено: 2026-08-05
Просмотров: 40062
Описание:
Физически возможно ли запустить модель искусственного интеллекта с 2,78 триллионами параметров на процессоре с всего лишь 8,24 ГБ оперативной памяти и без видеопамяти графического процессора? Представляем вашему вниманию движок на чистом C, состоящий из 6000 строк кода, который воспроизводит Kimi K3 от Moonshot напрямую с NVMe-накопителя с помощью скомпилированного бинарного файла размером 176 КБ.
🔔 Подпишитесь: / @cloud-codes
💙 Станьте участником: / @cloud-codes
🐦 Twitter/X:
https://x.com/cloud_codes
💬 Discord:
/ discord
В этом подробном обзоре Cloud Codes разбирает архитектуру компьютера и механику памяти, лежащие в основе чистого C-движка Фарида Хана, проекта WASTE Марко Бамбини и проекта deltafin на Rust. Мы исследуем, как архитектура Kimi K3 Mixture-of-Experts (MoE) поддерживает 96,3% своих весов неактивными (всего 104 байта активных параметров на токен), как Kimi Delta Attention поддерживает фиксированное рекуррентное состояние объемом 626 МБ и как NVMe Direct I/O передает 109 ГБ плотных весов транка с диска, не превышая лимит системной оперативной памяти в 8,24 ГБ.
Кроме того, мы анализируем жесткий компромисс между памятью и скоростью: почему работа в 8 ГБ ОЗУ приводит к медленной скорости в 32,69 секунды на токен, как масштабирование до 29 ГБ ОЗУ (WASTE) ускоряет выполнение в 16 раз до 0,50 токенов/сек, и почему обмен объема памяти на пропускную способность хранилища доказывает, что локальные аппаратные ограничения являются предположениями о загрузке, а не законами физики.
Если это помогло вам понять архитектуру бэкэнда, проектирование системы и как создавать более быстрое программное обеспечение, подпишитесь на Cloud Codes, чтобы каждую неделю получать новый разбор инфраструктуры! Создавайте, решайте задачи, развертывайте.
🔗 Упомянутые репозитории и источники:
• Движок Fareed Khan C: https://github.com/FareedKhan-dev/kim...
• Движок WASTE (SQLite Cloud): https://github.com/sqliteai/waste
• Движок Deltafin (порт на Rust): https://github.com/gavamedia/deltafin
• Модель карты Moonshot AI Kimi K3: https://huggingface.co/moonshotai/Kim...
• Ссылка на llama2.c Андрея Карпати: https://github.com/karpathy/llama2.c
⏱️ Разделы видео:
0:00 - Прорыв в разработке ноутбука с 2,78 триллионами параметров
1:04 - Что такое Kimi K3? (Фронтенд-модель Arena #1)
2:35 - Трюк с активными параметрами 3,7% (разреженность MoE)
3:21 - 4 способа уменьшения: MXFP4, Delta Attention и Latent KV
4:22 - Потоковая передача NVMe и прямой ввод-вывод (в обход системной памяти)
5:23 - Подвох: 32,69 секунды на токен!
7:08 - Сравнение 3 движков: C, Rust (deltafin) и WASTE
8:46 - Регулировка памяти: бенчмарки 8 ГБ против 29 ГБ против 2300 ГБ
9:34 - Аналогия Карпати с C: почему это объясняет LLM
10:43 - Окончательный вердикт: предположение, а не закон физики
#kimik3 #cprogramming #localai #cpu #systemdesign #ai #cloudcodes
Запросы пользователей:
fareed khan kimi k3 pure c engine github
run kimi k3 2.8 trillion parameter on 8gb ram cpu
kimi k3 mxfp4 nvme direct io streaming
waste vs deltafin vs pure c kimi k3 benchmark
how to run large moe models without gpu
kimi delta attention recurrent state memory overhead
32 seconds per token kimi k3 cpu разгрузка
чистый C вывод LLM Karpathy Llama C
стена памяти против стены пропускной способности локальный ИИ
облачные коды Kimi K3 8 ГБ ОЗУ разборка
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: