L'IA sur CPU et sans GPU, avec Openvino

En une phrase

La vidéo explore l'exécution d'un modèle linguistique d'extraction d'entités sur CPU sans GPU en utilisant OpenVINO d'Intel, comparant les performances des versions quantifiées (8-bit, 4-bit) et non quantifiées avec celles du GPU, et conclut que la quantification 8-bit est un bon compromis pour ce cas d'usage spécifique.

Points clés

  • Exécution de l'IA sur CPU : L'objectif principal est de démontrer l'exécution d'un modèle linguistique (Facebook AI/XLM-RoBERTa large fine-tuned au format SafeTensor) sur un processeur (CPU) plutôt qu'un GPU, en utilisant l'outil OpenVINO d'Intel, pour des tâches comme l'extraction d'entités dans la préparation de RAG.
  • Présentation d'OpenVINO : OpenVINO est un moteur d'exécution léger d'Intel, avec des APIs C++ et Python, optimisé pour les processeurs Intel (mais fonctionnant aussi avec AMD, et expérimentalement sur Apple), capable de convertir et de quantifier (en 8-bit ou 4-bit) des modèles SafeTensor en fichiers .bin et XML.
  • Sécurité des modèles : Le format SafeTensor est sécurisé, sans code Python caché. Les fichiers .bin générés par OpenVINO sont également considérés comme sûrs, et des outils sont présentés pour visualiser les poids d'un modèle afin de rassurer les équipes de sécurité sur le contenu d'un modèle "open-weight".
  • Comparaison des performances CPU vs. GPU : Les tests montrent que l'exécution sur GPU (RTX 4090) est environ trois fois plus rapide que sur CPU via OpenVINO avec un modèle non compressé. Pour l'extraction d'entités, la quantification 8-bit est identifiée comme le meilleur compromis performance/précision (F-score), malgré une légère dégradation de la performance par rapport au GPU.
  • Outils d'analyse complémentaires : La vidéo présente des programmes Python pour récupérer les informations système (`systeminfo.py`) et pour convertir des checkpoints de modèles en fichiers texte volumineux (10 Go) afin d'examiner et de comprendre les poids du modèle, ainsi qu'un programme pour lire ces grands fichiers.

Ressources

  • OpenVINO — moteur d'exécution d'Intel pour l'IA sur diverses architectures
  • Intel — développeur d'OpenVINO et de processeurs
  • GitHub — plateforme d'hébergement de code source
  • spaCy — bibliothèque Python pour le traitement du langage naturel
  • Hugging Face — plateforme de modèles pré-entraînés pour l'IA
  • Facebook AI/XLM-RoBERTa large fine-tuned — modèle linguistique mentionné
  • SafeTensor — format de modèle sécurisé
  • Python — langage de programmation
  • Anaconda — distribution pour la science des données
  • Spyder — IDE Python inclus dans Anaconda
  • AMD — fabricant de processeurs
  • Apple — fabricant de systèmes informatiques
  • Nvidia — fabricant de GPU (pour la RTX 4090)
  • Tipeee — plateforme de financement participatif
  • LinkedIn — réseau social professionnel
  • Visual Studio — environnement de développement intégré
  • Notepad — éditeur de texte simple