Bien qu’il existe des applications comme LM Studio et GPT4All pour exécuter des modèles d’IA localement sur des ordinateurs, nous n’avons pas beaucoup d’options de ce type sur les téléphones Android. Cela dit, MLC LLM a développé une application Android appelée MLC Chat qui vous permet de télécharger et d’exécuter des modèles LLM localement sur des appareils Android. Vous pouvez télécharger de petits modèles d’IA (2B à 8B) comme Llama 3, Gemma, Phi-2, Mistral, etc. Sur cette note, commençons.
Note:
Actuellement, MLC Chat n’utilise pas le NPU intégré sur tous les appareils Snapdragon, la génération de jetons est donc largement lente. L’inférence est effectuée uniquement sur le processeur. Certains appareils comme le Samsung Galaxy S23 Ultra (alimenté par Snapdragon 8 Gen 2) sont optimisés pour exécuter l’application MLC Chat afin que vous puissiez avoir une meilleure expérience.
- Allez-y et téléchargez le Application MLC Chat (Gratuit) pour les téléphones Android. Vous devrez télécharger le fichier APK (148 Mo) et l’installer.
- Ensuite, lancez l’application MLC Chat et vous verrez un liste des modèles d’IA. Il prend même en charge le dernier modèle Llama 3 8B et vous propose également des options telles que Phi-2, Gemma 2B et Mistral 7B.
- J’ai téléchargé celui de Microsoft Modèle Phi-2 car il est petit et léger.
- Une fois le modèle téléchargé, appuyez sur le bouton de discussion à côté du modèle.
- Maintenant, vous pouvez commencer à discuter avec le modèle AI localement sur votre téléphone Android. Vous n’avez même pas besoin d’une connexion Internet.
- Lors de mes tests, Phi-2 a bien fonctionné sur mon téléphone mais il y a eu des hallucinations. Gemma a refusé de se présenter. Et Llama 3 8B était trop lent.

- Sur mon OnePlus 7T, alimenté par le SoC Snapdragon 855+, une puce vieille de cinq ans, il a généré une sortie à 3 jetons par seconde lors de l’exécution de Phi-2.
Voici donc comment vous pouvez télécharger et exécuter des modèles LLM localement sur votre appareil Android. Bien sûr, la génération de jetons est lente, mais cela montre que vous pouvez désormais exécuter des modèles d’IA localement sur votre téléphone Android. Actuellement, c’est en utilisant uniquement le CPUmais avec la mise en œuvre de Qualcomm AI Stack, les appareils Android basés sur Snapdragon peuvent exploiter le NPU, le GPU et le CPU dédiés pour offrir de bien meilleures performances.
Du côté d’Apple, les développeurs utilisent déjà le Cadre MLX pour une inférence locale rapide sur les iPhones. Cela génère près de 8 jetons par seconde. Attendez-vous donc à ce que les appareils Android prennent également en charge le NPU intégré et offrent d’excellentes performances. À propos, Qualcomm lui-même affirme que Snapdragon 8 Gen 2 peut générer 8,48 jetons par seconde lors de l’exécution d’un modèle 7B plus grand. Il fonctionnerait encore mieux sur un modèle quantifié 2B.
Quoi qu’il en soit, tout cela vient de nous. Si vous souhaitez discuter avec vos documents en utilisant un modèle d’IA local, consultez notre article dédié. Et si vous rencontrez des problèmes, faites-le-nous savoir dans la section commentaires ci-dessous.
Soutenez notre effort ❤️
Si vous avez apprécié cet article, pensez à laisser un pourboire pour nous aider à continuer à publier du contenu de qualité.






















