
Au cours du mois écoulé, de plus en plus de personnes ont commencé à exécuter des grands modèles IA en local sur leur Mac. Beaucoup utilisent Ollama pour lancer différents modèles, puis les appellent via OpenCat ou un client de bureau Ollama. Mais une expérience très frustrante revient systématiquement : c'est lent, le raisonnement est saccadé, et on obtient seulement quelques tokens par seconde.
Le problème est encore plus flagrant sur un Mac Mini ou une machine avec seulement 16 Go de RAM. Aujourd'hui, je vous présente un outil d'accélération incontournable pour faire tourner des modèles en local sur Mac — OMLX.
Il permet d'accélérer le raisonnement de plus de 10×, rendant les grands modèles parfaitement utilisables même sur un Mac Mini d'entrée de gamme.
1. Pourquoi a-t-on besoin d'OMLX ?
Quand on lance un modèle local sur Mac, l'architecture ressemble généralement à ceci :
Interface utilisateur (OpenCat / client bureau) → Ollama → modèle local
Mais par défaut :
- L'efficacité d'inférence est faible
- Le KV Cache est mal exploité
- La répartition CPU/GPU est sous-optimale
Ce qui se traduit souvent par :
- Les réponses arrivent lettre par lettre
- 3 à 5 tokens par seconde
- Une question simple met plusieurs dizaines de secondes, voire plusieurs minutes
En usage quotidien, l'expérience est vraiment médiocre.
2. Qu'est-ce qu'OMLX ?
OMLX est un serveur d'accélération pour modèles IA en local sur Mac. Ses fonctions principales :
- ✅ Optimiser l'inférence des modèles locaux
- ✅ Accélérer la génération de tokens
- ✅ Gérer le cache des modèles
- ✅ Fournir une interface compatible OpenAI API
- ✅ Intégrer des tests de charge
En résumé : OMLX = serveur d'accélération pour modèles IA locaux sur Mac
Après déploiement, la vitesse des modèles locaux augmente généralement de 5 à 10×.
3. Configurations recommandées pour Mac Mini
Si vous avez un Mac Mini avec 16 Go de RAM, voici les configurations conseillées :
| Modèle | Taille | Appareil recommandé |
|---|---|---|
| Qwen3.5 4B | ~3 Go | Mac 8 Go |
| Qwen3.5 9B | ~6,6 Go | Mac 16 Go |
| Qwen3.5 27B | ~17 Go | 32 Go+ |
Le modèle 9B offre un excellent équilibre entre performances et qualité, c'est le choix idéal pour un Mac Mini 16 Go.
4. Installer Ollama
Commencez par installer Ollama :
- Rendez-vous sur le site officiel pour télécharger et installer : https://ollama.com
- Ouvrez le terminal après l'installation
- Téléchargez le modèle Qwen3.5 9B :
ollama pull qwen3.5:9b
Taille du téléchargement : environ 6,6 Go.
Une fois le téléchargement terminé, testez le modèle :
ollama run qwen3.5:9b "2,6,12,20,30,(?) 这个数列的规律是什么?"
Mais avec l'inférence par défaut d'Ollama, la vitesse peut être très lente :
| Étape | Durée |
|---|---|
| Début de génération | 20 secondes |
| Réponse complète | 1 min 50 s |
5. Installer OMLX
5.1 Prérequis
Avant l'installation, assurez-vous qu'OpenClaw est déjà installé sur votre Mac. Si ce n'est pas le cas, utilisez la commande d'installation en un clic :
curl -fsSL https://openclaw.ai/install.sh | bash
OpenClaw dépasse désormais les 4 000 stars sur GitHub.
5.2 Télécharger OMLX
Rendez-vous sur la page Release du projet pour télécharger la dernière version :
- GitHub : https://github.com/jundot/omlx
- Téléchargement via cloud : https://pan.quark.cn/s/b9503bb71e13
Attention à bien choisir la bonne version :
| Version du fichier | Appareil concerné |
|---|---|
| Version square | Anciens Mac |
| Version tar | M5 / macOS le plus récent |
Après le téléchargement, glissez simplement dans Applications pour installer.
6. Lancer le serveur OMLX
Une fois OMLX ouvert, configurez comme suit :
- Port par défaut : 8000
- Clé API : mettez ce que vous voulez, par exemple :
12345678
Cliquez sur démarrer. Quand vous voyez un état vert, le serveur est opérationnel.
Accédez ensuite à l'interface d'administration pour la configuration avancée.
7. Configurer le cache du modèle (étape cruciale)
Dans les paramètres, voici la configuration recommandée :
Limitation mémoire
Pour un Mac 16 Go :
- Cache chaud : 4 Go
- Cache froid : 8 Go
Cache froid (fortement recommandé)
Rôle :
- Sauvegarder le KV cache
- Accélérer le prochain démarrage du modèle
- Améliorer considérablement l'efficacité de l'inférence contextuelle
8. Télécharger le modèle
Attention : OMLX ne reconnaît pas le format de modèle d'Ollama, il faut donc retélécharger le modèle.
Dans l'interface d'administration OMLX :
- Cherchez le modèle :
qwen3.5:9b - Téléchargez-le directement
- Le modèle se charge automatiquement une fois le téléchargement terminé
9. Connecter OpenCat
Maintenant, raccordez OMLX à OpenCat :
- Lancez OpenCat dans le terminal
- Configurez le Provider comme
Custom Provider - Adresse API :
http://localhost:8000/v1 - Clé API : laissez vide (ou mettez la clé que vous avez définie)
- ID du modèle : copiez l'ID du modèle depuis l'interface OMLX
Une fois configuré, vous êtes prêt à l'utiliser.
10. Comparaison de vitesse en conditions réelles
Même question : 2,6,12,20,30,(?) 这个数列的规律是什么?
| Solution | Durée |
|---|---|
| Ollama natif | 1 min 50 s |
| OMLX accéléré | 10 à 15 secondes |
Un gain de vitesse proche de 10× ! La réponse est quasi instantanée.
11. Fonctionnalités avancées d'OMLX
1. Tests de performance matriciels
Permet de tester :
- Les performances mono-thread
- Les performances multi-thread
- La charge concurrentielle
Utile pour évaluer le comportement du modèle sous différentes charges.
2. Compatibilité OpenAI API
Prend en charge :
- Le format OpenAI API
- L'intégration de modèles Cloud
- La configuration personnalisée de modèles
Peut être utilisé directement comme un serveur OpenAI local.
3. Persistance du KV Cache
Améliore considérablement :
- La vitesse de démarrage du modèle
- L'efficacité de l'inférence contextuelle
- L'expérience de conversation multi-tours
12. Résumé et recommandation
Si vous voulez exécuter des grands modèles IA en local sur votre Mac, cette combinaison est vivement recommandée :
OMLX + Ollama + OpenCat
Avantages :
- ✅ Exécution locale, confidentialité garantie
- ✅ Pas de consommation de tokens, gratuit
- ✅ Gain de vitesse considérable (5 à 10×)
- ✅ Parfaitement exploitable sur Mac Mini
- ✅ Basculer librement entre plusieurs modèles
En particulier pour ceux qui aiment bidouiller avec l'IA locale + les outils d'automatisation, cette solution est vraiment top.
Ressources utiles :
- OMLX GitHub : https://github.com/jundot/omlx
- OpenClaw : https://openclaw.ai
- Modèle Qwen3.5 : https://ollama.com/library/qwen3.5
J'espère que cet article vous sera utile !