Tu veux mettre un assistant IA en ligne et les offres VPS commencent à quelques euros. Est-ce suffisant ? La première question n’est pas le nombre de gigaoctets. C’est ce que le serveur va réellement exécuter.

Une app qui envoie des requêtes à Grok ou OpenAI ne calcule pas elle-même les réponses du modèle. Elle gère les utilisateurs, les appels, les fichiers et éventuellement une base de données. Faire tourner un modèle local ajoute une charge très différente.

Dessiner le trajet d’une requête

Si tu utilises une API, un VPS modeste peut être un point de départ pour une petite charge. Ce n’est pas une garantie de capacité. Le nombre de connexions, les pièces jointes, la base et les tâches en arrière-plan peuvent saturer le serveur bien avant le modèle distant.

Pour un modèle local, pars du modèle exact, de sa quantification et du moteur d’inférence. Les poids ne sont qu’une partie de la mémoire utilisée. Le contexte, les requêtes simultanées et le moteur ajoutent leurs besoins. Ne déduis pas la RAM nécessaire de la seule taille du téléchargement.

architecture.txt
Avec une API
Navigateur → ton serveur → API du fournisseur

            base de données

Avec un modèle local
Navigateur → ton serveur → moteur d’inférence

                         RAM / GPU local

Dans les deux cas
Authentification → quotas → file d’attente bornée
Deux architectures, pas deux configurations équivalentes

Mesurer avant de prendre plus gros

Sur un environnement de test, rejoue un parcours avec des données fictives et augmente progressivement la concurrence. Observe la mémoire disponible, le disque, les erreurs et le temps de réponse. Les commandes Linux ci-dessous donnent un aperçu de la machine, pas un test de capacité à elles seules.

server-check.sh
# Mémoire disponible et swap
free -h

# Espace disque
df -h

# Charge et processus
uptime
ps -eo pid,comm,%mem,%cpu --sort=-%mem | head -n 12

# Si l’app tourne dans Docker
docker stats --no-stream
Observation en lecture seule sur ton propre serveur Linux

Garder de la marge pour les jours moins calmes

Un serveur qui tient dix requêtes consécutives ne tient pas forcément dix requêtes simultanées. Limite le travail en cours et refuse proprement ce que tu ne peux pas traiter. Si la latence vient de l’API, doubler la RAM du VPS ne corrigera pas ce délai.

Je choisirais une taille à partir de ces mesures, en gardant de la marge pour les sauvegardes et les mises à jour. Un petit serveur bien compris vaut mieux qu’une grosse machine dont personne ne surveille les erreurs.