Zheat Logo
    YohanYohanSenior Software Engineer

    Votre quota est épuisé. Modèles locaux, usage hybride.

    Le prix du token baisse, la conso monte, les quotas meurent plus vite. Je suis passé vers du local sur une machine à grosse RAM. Hybride : le cloud pour le dur. Pas besoin d'un dieu pour un CRUD.

    Voir sur LinkedIn

    Votre quota est épuisé quand la conso cloud dépasse le plan, même si le prix moyen du token baisse. La consommation ne fait qu'augmenter. Les prix allant vers le bas, des cas d'usage deviennent envisageables. Ils sont donc envisagés et la consommation augmente.

    Plus les mois passent, plus mes workflows gagnent en complexité et en autonomie. Le problème : mes quotas s'épuisent de plus en plus vite. Je ne pense pas être le seul, mais je me sens dépendant, c'est devenu impossible de revenir en arrière sur cette nouvelle façon de travailler.

    URL canonique : https://www.zheat.xyz/fr/insights/quota-exhausted-local-models/


    Sommaire

    1. Pourquoi les quotas meurent plus vite ?
    2. Que reste-t-il quand le quota est vide ?
    3. GPU vs MacBook / DGX Spark
    4. Quel modèle local ?
    5. C'est quoi un usage hybride ?
    6. FAQ
    7. Suite

    Pourquoi les quotas meurent plus vite ?

    Le prix moyen du token baisse et la consommation ne fait qu'augmenter. Les prix allant vers le bas, des cas d'usage deviennent envisageables. Ils sont donc envisagés et la consommation augmente.

    Même les providers peinent à répondre à la demande, Ollama par exemple ferme ses inscriptions aux abonnements Max.


    Que reste-t-il quand le quota est vide ?

    Il reste une solution : avoir ses propres machines.

    L'erreur, je pense, est de vouloir toujours le meilleur modèle pour nos tâches. Aujourd'hui, il est tout à fait possible de travailler avec des modèles locaux et d'obtenir des résultats satisfaisants.

    Il y a principalement deux choses à prendre en compte, la taille de RAM disponible et la bande passante.


    GPU vs MacBook / DGX Spark

    Deux catégories de machines existent :

    MachineRAM vs bande passanteDans cette note
    Les cartes graphiquesPlus chères par rapport à la taille de RAM, très véloces en bande passanteLes Rolls-Royce
    MacBook ou machines type DGX SparkPlus de RAM, bande passante moins rapideLe choix que j'ai fait, parce que je ne suis pas si riche (voire pas du tout)

    Quel modèle local ?

    Pour les machines type Spark, les modèles MoE vont être particulièrement intéressants. J'ai porté mon dévolu sur ce modèle : Qwen 3.6 35B A3B NVFP4. C'est le meilleur compromis que j'ai trouvé en termes de vélocité/intelligence.

    ModèleCe qui s'est passé
    Qwen 3.6 35B A3B NVFP4Meilleur compromis vélocité / intelligence
    GLM-4.7-Flash-AWQ-4bitProblèmes de stabilité
    Qwen3.8-27B-NVFP4Trop lent au quotidien. Je pourrais le garder pour du planning ponctuel.

    Les benchmarks de ces modèles se trouvent sur Spark-Arena, pour ceux qui ont des MacBook récents et qui voudraient essayer, vous devriez pouvoir obtenir des performances similaires.


    C'est quoi un usage hybride ?

    Le but dans les prochains mois sera d'avoir un usage hybride et de réserver les modèles dans le cloud à ce qui est le plus difficile. Pas besoin de Mythos, Zeus ou Dieu pour faire un CRUD et renvoyer l'info au front.

    L'autre avantage, l'économie de token ne s'applique plus à vous et les modèles ne s'arrêtent pas de tourner lorsque le quota est dépassé.

    Si vous pensez que les modèles locaux ne sont pas capables de coder, vous vous trompez.

    Ça va avec la fausse bonne idée des agents en parallèle : la capacité locale est plus basse, et ça peut être le point.


    FAQ

    Pourquoi les quotas IA meurent plus vite alors que le token baisse ? Le prix moyen du token baisse et la consommation ne fait qu'augmenter. Moins cher, plus de cas d'usage envisageables. Ils sont envisagés. La conso monte. Les workflows se complexifient. Les quotas meurent plus vite.

    Les modèles locaux peuvent-ils remplacer le cloud quand le quota est vide ? Ils peuvent couvrir beaucoup du quotidien avec des résultats satisfaisants. Gardez le cloud pour ce qui est vraiment dur. Pas besoin d'un dieu pour un CRUD.

    GPU ou MacBook / DGX Spark ? Les GPU sont plus véloces en bande passante et plus chères pour la RAM. MacBook ou Spark : plus de RAM, bande passante moins rapide. Je suis parti sur le deuxième, parce que je ne suis pas si riche.

    Quel modèle local ? Qwen 3.6 35B A3B NVFP4, meilleur compromis vélocité / intelligence sur des machines type Spark. GLM-4.7-Flash-AWQ-4bit : stabilité. Qwen3.8-27B-NVFP4 : trop lent au quotidien.

    Où sont les benchmarks ? Sur Spark-Arena. Un MacBook récent devrait obtenir des performances similaires.


    Suite