← Retour au blog
Outils & Setup · LLM open-source · Lecture 8 min

Ollama Cloud × Claude Code : le setup complet Comment connecter Ollama Cloud à Claude Code et Hermès Agent pour ne plus jamais être bloqué par tes tokens

Tutoriel pas-à-pas pour connecter Ollama Cloud à Claude Code et Hermès Agent, et ne plus jamais être bloqué par tes tokens.

💡 Ce que tu retiens en 30 secondes :
  • Coût marginal quasi-nul sur les modèles open-source (Llama, Qwen, DeepSeek)
  • Pas de rate limit agressif, tu peux enchaîner les requêtes
  • Confidentialité : tes données ne servent pas à entraîner le modèle
  • Une fallback chain qui te fait baisser ta facture LLM de 60 à 80%
🛠️

Le problème : tomber à court de tokens au pire moment

Si tu utilises Claude Code ou Hermès Agent, tu connais la douleur : tu tombes à court de tokens au pire moment, en plein debug critique, et tu dois attendre le reset mensuel ou sortir la CB. Ollama Cloud règle ça. Voici comment tout brancher en 10 minutes.

01

Pourquoi Ollama Cloud plutôt qu'un autre provider

économie · variété

Ollama Cloud te donne accès à des modèles open-source (Llama, Qwen, DeepSeek, Mistral) via une API simple, compatible OpenAI. Le coût marginal est quasi-nul, pas de rate limit agressif, et tes données ne servent pas à entraîner le modèle. Tu peux router entre un gros modèle (DeepSeek V3) pour les tâches complexes et un petit (Llama 8B) pour les tâches simples.

Avantage clé pour les solo founders : tu peux te permettre de générer du volume sans regarder la facture. Une veille sectorielle qui tourne 24/7 sur Llama 70B coûte quelques centimes par jour.

02

Configurer Claude Code

5 min de setup

Dans ton shell, configure les variables d'environnement :

Tu peux aussi créer un alias pour switcher rapidement entre providers. Le jour où tu veux basculer sur Anthropic direct, un alias suffit.

⚙️ Commandes shell

export ANTHROPIC_BASE_URL=https://ollama.com/v1 export ANTHROPIC_API_KEY=ollama-ta-cle Alias : alias cc-ollama='ANTHROPIC_BASE_URL=... ANTHROPIC_API_KEY=... claude'

03

Brancher Hermès Agent

config.yaml

Dans ~/.hermes/config.yaml, ajoute un custom provider qui pointe vers Ollama Cloud. Tu peux ensuite router une partie de tes tâches vers ce provider dans les cron jobs ou directement à la main.

Avantage : tu gardes Claude pour les tâches critiques (code, raisonnement complexe), et tu délègues la veille, le tri, les résumés à Ollama.

⚙️ Extrait config.yaml

providers: - name: ollama-cloud base_url: https://ollama.com/v1 api_key: ollama-ta-cle models: - name: deepseek-v3 context: 128000 - name: llama-3.3-70b context: 128000

04

La stratégie de bascule (fallback chain)

économie 60-80%

Le setup le plus malin : configurer une chaîne de fallback. Si Claude Sonnet échoue ou est trop lent, Hermès bascule automatiquement sur Ollama. Tu définis l'ordre dans la config et tu n'y penses plus.

Concrètement, dans un cron job : primary = Claude Sonnet, fallbacks = [DeepSeek V3, Llama 70B]. Si Claude est saturé, DeepSeek prend le relais. Pas d'interruption, pas d'attente.

💡 Le bon réflexe

À éviter sur Ollama Cloud : génération de code React complexe ou raisonnement multi-étapes long. Reste sur Claude Sonnet pour ça, le delta de qualité justifie le surcoût.

→ LE BILAN

Le bon setup, c'est pas un seul modèleC'est un mix intelligent selon la tâche

La vraie force c'est le fallback chain : Claude Sonnet pour le code complexe, Ollama Cloud pour la recherche, le résumé, la classification. Ton coût par tâche baisse de 60-80% sans perte de qualité sur les tâches critiques. Si tu fais du code, reste sur Claude. Si tu fais de la veille ou du tri, Ollama suffit largement.

Tu veux qu'on te configure tout ça pour ton stack ?

Setup complet en 30 min : API key, providers, fallback chain, et un test sur ton use case réel. Tu repars avec un système qui tourne.