2026-08-05 · 4 min de lecture

Modèle Whisper pour l'IA de périphérie sur mobile

Le modèle Whisper d'OpenAI est un système de reconnaissance vocale automatique (ASR) basé sur des transformeurs qui est devenu une pierre angulaire pour les applications d'IA de périphérie sur appareil. En exécutant Whisper localement sur les appareils mobiles, les développeurs peuvent garantir la confidentialité des utilisateurs, éliminer la latence des allers-retours cloud et fournir des fonctionnalités hors ligne. Cet article explore les considérations clés pour déployer Whisper sur mobile, y compris les compromis sur la taille du modèle, les variantes linguistiques, la gestion de l'audio long et l'optimisation des performances.

Tailles de modèle et compromis

Whisper est disponible en plusieurs tailles, chacune équilibrant précision, vitesse et consommation de ressources. La principale différence est le nombre de paramètres, qui détermine comment le modèle gère les audio complexes, les accents et le bruit de fond. Le modèle tiny (39M paramètres) est le plus rapide et le plus léger, idéal pour les appareils d'entrée de gamme où la latence est critique, bien qu'il soit plus sujet aux erreurs. Le modèle base (74M paramètres) offre un meilleur équilibre pour la transcription générale et est souvent le plus grand qui fonctionne confortablement sur du matériel très contraint. Le modèle small (244M paramètres) est souvent considéré comme le point idéal pour le mobile, offrant un saut de précision significatif tout en restant dans la mémoire des smartphones modernes. Les modèles medium (769M) et large (1.55B) offrent la plus haute précision mais nécessitent beaucoup de RAM et de puissance de calcul, les rendant irréalisables pour une utilisation mobile en temps réel sans accélération matérielle dédiée.

Tailles et caractéristiques des modèles Whisper
ModèleParamètresVitessePrécisionUtilisation typique
Tiny39MPlus rapideFaibleAppareils d'entrée de gamme
Base74MRapideModéréeTranscription générale
Small244MModéréeÉlevéePoint idéal mobile
Medium769MLentePlus élevéeAppareils haut de gamme
Large1.55BPlus lenteMaximaleServeur/hors ligne
← Faites défiler vers la droite pour en voir plus →

Modèles anglais uniquement vs multilingues

La plupart des tailles de Whisper (tiny, base, small, medium) sont disponibles en deux versions : multilingue et anglais uniquement (.en). Les modèles multilingues sont entraînés sur un ensemble de données diversifié de 99 langues, les rendant polyvalents mais légèrement plus grands et plus complexes. Les variantes anglais uniquement sont entraînées exclusivement sur des données anglaises, offrant généralement une meilleure précision pour les tâches en anglais et une utilisation plus efficace des ressources. Pour les applications mobiles ciblant les utilisateurs anglophones, les modèles .en sont souvent préférés pour réduire la taille du modèle et améliorer les performances.

Gestion de l'audio long : la fenêtre de 30 secondes

Whisper a un champ réceptif fixe de 30 secondes. Pour transcrire un audio plus long, les développeurs utilisent une approche de fenêtre glissante ou de découpage. L'audio est divisé en segments de 30 secondes, traités individuellement, puis assemblés. Pour éviter la perte de contexte aux frontières, les implémentations utilisent souvent des segments qui se chevauchent (par exemple 3 à 10 secondes de chevauchement) pour garantir que les mots ou phrases coupés par une frontière de segment soient capturés correctement dans la fenêtre suivante. Cette technique est essentielle pour traiter des fichiers de plus de 30 secondes, comme des podcasts ou des réunions enregistrées.

Déploiement sur mobile : ExecuTorch et CoreML

Exécuter Whisper sur mobile nécessite une optimisation pour gérer les limites thermiques et de mémoire. Les développeurs peuvent utiliser des frameworks comme ExecuTorch pour le déploiement PyTorch multiplateforme ou convertir les modèles en CoreML pour iOS. CoreML permet au modèle d'exploiter le Neural Engine d'Apple (ANE), améliorant considérablement les performances et réduisant la consommation d'énergie par rapport à l'exécution sur CPU uniquement. La quantification est également courante : les modèles sont quantifiés (par exemple en formats GGML ou GGUF) pour tenir dans la RAM mobile, réduisant parfois l'empreinte de plusieurs gigaoctets. Sur le matériel mobile moderne, les modèles plus petits comme tiny ou base peuvent fonctionner nettement plus vite que le temps réel. Le modèle small est souvent la limite pratique pour la dictée interactive en temps réel, tandis que les modèles plus grands sont réservés au traitement de fichiers hors ligne où la vitesse est moins critique que la précision.

En résumé, choisir le bon modèle Whisper pour mobile implique d'équilibrer précision, vitesse et contraintes de ressources. Pour la plupart des applications d'IA de périphérie, le modèle small avec variante anglais uniquement offre le meilleur compromis, tandis que les frameworks de déploiement comme ExecuTorch et CoreML garantissent une exécution efficace sur le matériel de l'appareil.

Travaillons ensemble

Vous avez besoin de plus d'informations, d'aide pour votre projet ou pour développer une idée?

Qu'il s'agisse d'une question simple, d'un doute rapide ou d'une discussion de 5 minutes, envoyez-moi un message—cela ne coûte rien et je suis toujours prêt à vous aider. J'aime comprendre un problème, être créatif dans les solutions et me concentrer sur des idées simples, fiables et faciles à réaliser rapidement.

Me contacter

Changer de sujet

Choisissez un sujet spécialisé à explorer: