Tu veux mettre un assistant IA en ligne et les offres VPS commencent à quelques euros. Est-ce suffisant ? La première question n’est pas le nombre de gigaoctets. C’est ce que le serveur va réellement exécuter.
Une app qui envoie des requêtes à Grok ou OpenAI ne calcule pas elle-même les réponses du modèle. Elle gère les utilisateurs, les appels, les fichiers et éventuellement une base de données. Faire tourner un modèle local ajoute une charge très différente.
Dessiner le trajet d’une requête
Si tu utilises une API, un VPS modeste peut être un point de départ pour une petite charge. Ce n’est pas une garantie de capacité. Le nombre de connexions, les pièces jointes, la base et les tâches en arrière-plan peuvent saturer le serveur bien avant le modèle distant.
Pour un modèle local, pars du modèle exact, de sa quantification et du moteur d’inférence. Les poids ne sont qu’une partie de la mémoire utilisée. Le contexte, les requêtes simultanées et le moteur ajoutent leurs besoins. Ne déduis pas la RAM nécessaire de la seule taille du téléchargement.
Avec une API
Navigateur → ton serveur → API du fournisseur
↓
base de données
Avec un modèle local
Navigateur → ton serveur → moteur d’inférence
↓
RAM / GPU local
Dans les deux cas
Authentification → quotas → file d’attente bornée
Mesurer avant de prendre plus gros
Sur un environnement de test, rejoue un parcours avec des données fictives et augmente progressivement la concurrence. Observe la mémoire disponible, le disque, les erreurs et le temps de réponse. Les commandes Linux ci-dessous donnent un aperçu de la machine, pas un test de capacité à elles seules.
# Mémoire disponible et swap
free -h
# Espace disque
df -h
# Charge et processus
uptime
ps -eo pid,comm,%mem,%cpu --sort=-%mem | head -n 12
# Si l’app tourne dans Docker
docker stats --no-stream
Garder de la marge pour les jours moins calmes
Un serveur qui tient dix requêtes consécutives ne tient pas forcément dix requêtes simultanées. Limite le travail en cours et refuse proprement ce que tu ne peux pas traiter. Si la latence vient de l’API, doubler la RAM du VPS ne corrigera pas ce délai.
Je choisirais une taille à partir de ces mesures, en gardant de la marge pour les sauvegardes et les mises à jour. Un petit serveur bien compris vaut mieux qu’une grosse machine dont personne ne surveille les erreurs.