Ускорьте вывод Transformer на CPU с помощью Optimum и ONNX
Автор: Julien Simon
Загружено: 2022-11-08
Просмотров: 6227
Описание:
В этом видео я покажу, как ускорить вывод Transformer с помощью Optimum, библиотеки с открытым исходным кодом от Hugging Face, и ONNX.
Я беру модель DistilBERT, настроенную для классификации текста, экспортирую её в формат ONNX, затем оптимизирую и, наконец, квантую. Запустив тесты на экземпляре AWS c6i (архитектура Intel Ice Lake), мы ускорили исходную модель более чем в 2,5 раза и уменьшили её размер вдвое, используя всего несколько строк простого кода Python и без потери точности!
⭐️⭐️⭐️ Не забудьте подписаться, чтобы получать уведомления о новых видео ⭐️⭐️⭐️
⭐️⭐️⭐️ Хотите угостить меня кофе? Мне всегда пригодится больше :) https://www.buymeacoffee.com/julsimon ⭐️⭐️⭐️
Optimum: https://github.com/huggingface/optimum
Документация Optimum: https://huggingface.co/docs/optimum/o...
ONNX: https://onnx.ai/
Оригинальная модель: https://huggingface.co/juliensimon/di...
Код: https://gitlab.com/juliensimon/huggin...
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: