Une recherche « bot IA gratuit Discord » renvoie des dizaines d’options. Certaines sont réellement gratuites. La plupart ne le sont pas, du moins pas comme vous l’imaginez. Cet article détaille ce qui existe, les compromis et le coût réel du « gratuit » quand l’inférence IA entre en jeu.
Pourquoi l’« IA gratuite » est compliquée
Faire tourner un LLM coûte de l’argent. Chaque fois qu’un utilisateur envoie un message et reçoit une réponse, quelqu’un paie le calcul. Pour une API hébergée comme OpenAI ou Anthropic, vous payez au token. Pour un modèle auto-hébergé, vous payez en matériel, électricité et maintenance. Impossible d’y échapper : l’inférence a un coût marginal non nul.
Lorsqu’un service propose un « bot IA gratuit », l’une de ces situations s’applique :
- Vous payez directement l’inférence, par exemple en fournissant votre clé API.
- Le service absorbe le coût et le compense par des offres payantes, de la publicité ou de la collecte de données.
- Vous exécutez l’inférence vous-même, sur votre matériel, avec un modèle open source.
- L’offre gratuite est plafonnée à un faible volume, limitant les dépenses de calcul du fournisseur.
Identifier le cas applicable à chaque bot est essentiel pour savoir s’il convient à votre usage.
Les trois catégories de bots IA gratuits pour Discord
1. Bots open source auto-hébergés (gratuits, vous fournissez le matériel)
C’est la seule option où aucun tiers ne contrôle vos limites d’utilisation de l’IA. Vous exécutez un LLM open source localement ou sur un VPS, le connectez à Discord avec un bot écrit ou adapté par vos soins, et gérez tout.
Stack habituelle :
- Ollama pour servir les modèles locaux.
- discord.py ou discord.js pour le bot Discord.
- Un modèle comme Llama 3.1 8B, Mistral 7B ou Gemma 2 9B.
Ce que vous obtenez :
- Aucun coût par message en dehors de l’électricité.
- Un contrôle total du modèle, du prompt système et des données.
- Aucune limite imposée par un fournisseur d’IA, seulement celles de l’API Discord.
- Le traitement du modèle sur votre matériel, sans envoyer les messages à un fournisseur externe de LLM. Les messages transitent toujours par Discord.
Ce que vous perdez :
- Il faut du matériel. Un modèle à 7 milliards de paramètres à vitesse raisonnable demande un GPU avec au moins 8 Go de VRAM ou un Mac récent à mémoire unifiée. L’inférence CPU fonctionne, mais reste lente : plusieurs secondes par réponse pour un modèle 7B.
- Vous entretenez l’infrastructure : mises à jour, redémarrages, supervision et stockage des poids du modèle.
- La qualité est inférieure aux modèles de pointe. Llama 3.1 8B est capable, mais ce n’est pas GPT-4o ou Claude Sonnet. Il convient aux questions simples et au chat informel, moins au raisonnement nuancé ou aux dialogues complexes sur plusieurs tours.
- Aucune base de connaissances, analyse ou transmission humaine intégrée. Vous développez ce dont vous avez besoin.
Matériel minimal pour les modèles courants :
| Modèle | Paramètres | VRAM requise | RAM en CPU seul | Vitesse avec GPU |
|---|---|---|---|---|
| Gemma 2 2B | 2 milliards | ~2 Go | ~4 Go | ~60 tokens/s |
| Llama 3.1 8B | 8 milliards | ~6 Go | ~10 Go | ~40 tokens/s |
| Mistral 7B | 7 milliards | ~6 Go | ~10 Go | ~40 tokens/s |
| Llama 3.1 70B (Q4) | 70 milliards | ~40 Go | ~48 Go | ~15 tokens/s |
(Vitesses approximatives mesurées sur une RTX 4090. Les variantes quantifiées utilisent moins de mémoire avec une légère perte de qualité.)
2. Services gérés freemium (offre gratuite plafonnée)
Un tiers héberge ici l’IA et l’infrastructure du bot. Vous le configurez dans un tableau de bord web. L’offre gratuite autorise un usage limité ; vous payez pour davantage.
Exemples :
| Service | Offre gratuite | Limite de messages | Contrôle du modèle | Discord | Carte bancaire requise |
|---|---|---|---|---|---|
| Quickchat AI | Offre gratuite | Usage inclus variable selon l’offre | Géré par le fournisseur (modèles de pointe) | Oui, toutes les offres | Non |
| MEE6 | Offre gratuite | IA dans Premium uniquement | Géré par le fournisseur | Oui | Non pour le gratuit |
| Botpress | Offre gratuite | 2 000 messages entrants/mois | Configurable | Par intégration | Non |
L’offre gratuite Quickchat AI permet de tester sans carte bancaire. L’intégration Discord existe à tous les niveaux, pour connecter le bot et l’essayer avec de vrais utilisateurs avant de payer. Un clic suffit : dans External Apps, ouvrez Discord, cliquez sur Add to your Discord server, puis choisissez le serveur. Les offres payantes commencent avec Starter à 9 $US/mois, ou 8 $US/mois en facturation annuelle.
L’avantage des services gérés réside dans les fonctions autour de l’inférence : bases de connaissances issues du site et des documents, analyses de conversations (sentiment et thèmes), déploiement multicanal (le même agent sur le site, WhatsApp, Slack et Discord) et transfert à des humains quand l’IA ne résout pas. Construire cela sur un modèle auto-hébergé représente un véritable projet d’ingénierie.
MEE6 est surtout un bot de modération et d’animation. Le chat IA nécessite Premium (11,99 $US/mois début 2026). L’offre gratuite inclut les niveaux, les commandes de modération basiques et les messages de bienvenue, mais pas les conversations IA.
Botpress offre 2 000 messages entrants gratuits par mois, tous canaux confondus. Il propose un éditeur visuel de parcours et des configurations LLM personnalisées. Pour un simple bot Discord, sa configuration est plus complexe que Quickchat, car il vise les parcours structurés plutôt que le chat libre.
3. Bots avec votre clé API (vous payez le fournisseur du LLM)
Troisième catégorie : les bots open source exécutés sur un serveur mais utilisant une API commerciale (OpenAI, Anthropic, Google, etc.) pour l’inférence. Vous fournissez la clé. Le code du bot est gratuit, mais vous payez au token.
Exemples sur GitHub :
- GPT Discord Bot, l’exemple officiel d’OpenAI.
- Divers bots communautaires utilisant
discord.pyet le SDK Python OpenAI.
Coût par message avec des API commerciales (approximatif, début 2026) :
| Modèle | Entrée par million de tokens | Sortie par million de tokens | Coût approximatif par message* |
|---|---|---|---|
| GPT-4o mini | 0,15 $US | 0,60 $US | ~0,0003 $US |
| GPT-4o | 2,50 $US | 10,00 $US | ~0,005 $US |
| Claude 3.5 Haiku | 0,80 $US | 4,00 $US | ~0,002 $US |
| Claude Sonnet 4 | 3,00 $US | 15,00 $US | ~0,007 $US |
| Gemini 2.0 Flash | 0,10 $US | 0,40 $US | ~0,0002 $US |
*Hypothèse : environ 500 tokens en entrée et 200 en sortie par échange, sans historique. Avec l’historique, les coûts d’entrée augmentent linéairement avec la longueur du contexte.
À 1 000 messages par mois avec GPT-4o mini, vous dépenseriez environ 0,30 $US ; à 10 000, environ 3 $US. Ces montants paraissent faibles avant d’ajouter l’historique : si chaque message contient tout le contexte, par exemple 10 tours précédents, les tokens d’entrée passent d’environ 500 à 5 000. Le coût d’entrée est multiplié par dix et le coût total augmente aussi.
Comparaison des coûts selon l’approche
Le tableau estime le coût mensuel selon le volume. « Auto-hébergé » suppose un petit VPS ou du matériel existant. « Votre clé API » utilise les tarifs GPT-4o mini. « Géré » prend Quickchat AI comme référence.
| Messages mensuels | Auto-hébergé (Ollama + VPS) | Votre clé API (GPT-4o mini) | Géré (Quickchat AI) |
|---|---|---|---|
| 100 | ~5 à 20 $US (VPS) | ~0,03 $US | Gratuit ou Starter à 9 $US/mois |
| 1 000 | ~5 à 20 $US (VPS) | ~0,30 à 3 $US | Starter à 9 $US/mois ou Basic à 29 $US/mois |
| 5 000 | ~15 à 40 $US (VPS) | ~1,50 à 15 $US | Essential à 99 $US/mois ou Professional à 299 $US/mois |
| 10 000 | ~30 à 80 $US (VPS) | ~3 à 30 $US | Professional à 299 $US/mois ou Business à 999 $US/mois |
| 35 000 | ~60 à 150 $US (VPS) | ~10,50 à 105 $US | Business à 999 $US/mois ou Enterprise dès 0,50 $US/résolution |
La fourchette auto-hébergée dépend d’un VPS CPU seul, moins cher mais plus lent, ou d’une instance GPU. Hetzner propose des VPS CPU autour de 5 à 10 $US/mois capables d’exécuter un modèle 7B quantifié, avec des réponses en 5 à 15 secondes. Les instances GPU cloud, par exemple Lambda, RunPod ou Vast.ai, commencent vers 0,20 à 0,50 $US/h par GPU, soit 150 à 360 $US/mois en continu. Pour un usage intermittent, des instances spot ou GPU serverless peuvent réduire le montant.
La colonne clé API donne une fourchette car le coût dépend fortement de l’historique inclus à chaque requête. Le minimum correspond à un seul tour sans historique ; le maximum, à plusieurs tours avec environ 10 messages de contexte.
La colonne gérée reflète les prix Quickchat de juin 2026. Ces offres comprennent gestion de la base de connaissances, analyses et multicanal, absents des autres approches sans développement supplémentaire.
Installation rapide auto-hébergée : Python + discord.py + Ollama
Voici un exemple minimal fonctionnel de bot Discord avec Ollama pour l’inférence locale. Ollama doit être installé et actif, avec un modèle téléchargé, par exemple via ollama pull llama3.1:8b.
Prérequis
- Python 3.10 ou ultérieur.
- Ollama installé et actif (
curl -fsSL https://ollama.com/install.sh | sh). - Un modèle téléchargé :
ollama pull llama3.1:8b. - Un token de bot créé dans le Discord Developer Portal.
- Le bot ajouté au serveur avec
Send MessagesetRead Message History.
Installer les dépendances
pip install discord.py aiohttp
Code du bot
import discord
import aiohttp
import json
DISCORD_TOKEN = "your-bot-token-here"
OLLAMA_URL = "http://localhost:11434/api/chat"
MODEL = "llama3.1:8b"
SYSTEM_PROMPT = "You are a helpful assistant in a Discord server. Keep responses concise."
# Store conversation history per channel (in-memory, resets on restart)
conversations: dict[int, list[dict]] = {}
MAX_HISTORY = 10 # Keep last 10 messages per channel
intents = discord.Intents.default()
intents.message_content = True
client = discord.Client(intents=intents)
async def query_ollama(channel_id: int, user_message: str) -> str:
"""Send a message to Ollama and return the response."""
if channel_id not in conversations:
conversations[channel_id] = []
conversations[channel_id].append({"role": "user", "content": user_message})
# Trim history to avoid unbounded memory growth
if len(conversations[channel_id]) > MAX_HISTORY:
conversations[channel_id] = conversations[channel_id][-MAX_HISTORY:]
messages = [{"role": "system", "content": SYSTEM_PROMPT}] + conversations[channel_id]
payload = {
"model": MODEL,
"messages": messages,
"stream": False,
}
async with aiohttp.ClientSession() as session:
async with session.post(OLLAMA_URL, json=payload) as resp:
if resp.status != 200:
return f"Ollama returned status {resp.status}"
data = await resp.json()
reply = data["message"]["content"]
conversations[channel_id].append({"role": "assistant", "content": reply})
return reply
@client.event
async def on_ready():
print(f"Logged in as {client.user}")
@client.event
async def on_message(message: discord.Message):
# Ignore own messages
if message.author == client.user:
return
# Only respond when mentioned
if client.user not in message.mentions:
return
# Strip the mention from the message
content = message.content.replace(f"<@{client.user.id}>", "").strip()
if not content:
return
async with message.channel.typing():
reply = await query_ollama(message.channel.id, content)
# Discord has a 2000-character limit per message
if len(reply) > 2000:
for i in range(0, len(reply), 2000):
await message.reply(reply[i:i+2000])
else:
await message.reply(reply)
client.run(DISCORD_TOKEN)
Ces quelque 60 lignes donnent un bot IA fonctionnel qui répond quand on le mentionne. Il garde l’historique par salon en mémoire, perdu au redémarrage, et gère la limite Discord de 2 000 caractères par message.
Ce qui manque à ce bot minimal
Ce code convient aux tests et aux petits serveurs. Au-delà, plusieurs problèmes doivent être traités pour la production :
- Historique persistant. Le dictionnaire en mémoire disparaît au redémarrage. En production, les conversations seraient stockées dans Redis ou une base de données.
- Limitation du débit. Discord autorise 5 messages toutes les 5 secondes par salon. Un bot populaire nécessite des files d’attente.
- Requêtes simultanées. Ollama traite par défaut une requête à la fois. Plusieurs utilisateurs simultanés attendent en file. Vous pouvez utiliser plusieurs instances derrière un répartiteur de charge ou
OLLAMA_NUM_PARALLEL, disponible depuis la version 0.1.33. - Erreurs et nouvelles tentatives. Ollama peut planter, manquer de mémoire ou renvoyer des réponses malformées. Le bot doit gérer tous ces cas correctement.
- Gestion du contexte.
MAX_HISTORY = 10est simpliste. Mieux vaut compter les tokens et ajuster l’historique à la fenêtre du modèle (8 192 tokens par défaut pour Llama 3.1 8B, configurable jusqu’à 128 000, avec une dégradation sur les longs contextes). - Prise en charge des fils. Les échanges avec les bots se déroulent souvent en fils. Leur création et leur historique demandent une logique supplémentaire.
- Base de connaissances / RAG. Pour répondre depuis la documentation du projet, il faut créer des embeddings, les stocker dans une base vectorielle et retrouver les passages pertinents avant l’appel au LLM.
Pièges techniques
Limites de l’API Discord
Discord impose des limites à plusieurs niveaux :
- Par route : chaque endpoint a sa limite, renvoyée dans
X-RateLimit-Limit,X-RateLimit-RemainingetX-RateLimit-Reset. - Globale : 50 requêtes par seconde sur l’ensemble des endpoints.
- Messages par salon : 5 toutes les 5 secondes.
- Passerelle : 120 événements toutes les 60 secondes.
La bibliothèque discord.py gère automatiquement la plupart en mettant les requêtes en file lorsqu’une limite est atteinte. Un bot présent dans de nombreux serveurs ou salons peut néanmoins atteindre la limite globale. Il faut alors examiner le sharding, qui répartit les connexions aux serveurs entre plusieurs connexions à la passerelle.
Pour les bots utilisant l’intent MESSAGE_CONTENT, nécessaire à la lecture du texte, Discord exige une vérification au-delà de 100 serveurs. Il faut décrire le fonctionnement du bot et obtenir l’approbation de Discord.
Compromis de qualité des modèles
L’écart entre petits modèles open source et modèles commerciaux de pointe s’est réduit en deux ans, mais demeure. Comparaison approximative pour les tâches courantes :
| Tâche | Modèle local de 7 à 8 milliards | GPT-4o mini | GPT-4o / Claude Sonnet |
|---|---|---|---|
| Conversation informelle | Bon | Bon | Bon |
| Questions factuelles | Moyen, davantage d’hallucinations | Bon | Très bon |
| Génération de code | Basique | Bon | Très bon |
| Multilingue | Limité | Bon | Très bon |
| Respect des instructions | Moyen | Bon | Très bon |
| Maintien du personnage | Moyen | Bon | Bon |
Pour une communauté de joueurs centrée sur le chat informel et les recherches simples, un modèle local 8B convient. En assistance client, où l’exactitude compte, l’écart devient problématique. Rester dans son personnage dépend aussi beaucoup de la configuration : créer un chatbot IA de roleplay qui reste dans son personnage montre ce qu’un prompt de personnalité et une base canonique apportent même à un modèle standard.
Gestion de la fenêtre de contexte
C’est le défi technique le plus sous-estimé des bots Discord. Les conversations comportent plusieurs tours : les utilisateurs envoient beaucoup de messages courts et le bot doit se souvenir des échanges précédents.
À chaque réponse, il doit inclure l’historique dans le prompt. Cela signifie :
- Les tokens d’entrée augmentent linéairement avec la conversation.
- Pour les bots à API, le coût augmente lui aussi linéairement.
- Pour les modèles locaux, le temps d’inférence croît avec le contexte (quadratiquement pour le calcul d’attention, même si Flash Attention et d’autres optimisations aident).
- La conversation finit par dépasser la fenêtre : il faut couper le début, résumer l’ancien contenu ou commencer une nouvelle conversation.
Une méthode pratique consiste à garder les N derniers messages dans une fenêtre glissante et à les précéder d’un bref résumé du contexte ancien si la conversation est longue. Cela demande un appel LLM supplémentaire pour le résumé, mais borne le coût par message.
Conséquences pour la confidentialité
Elles varient fortement selon l’approche :
- Auto-hébergement : le traitement LLM reste sur votre matériel. Vous contrôlez la conservation et l’accès de cette partie, mais Discord transporte toujours les messages. C’est l’option offrant le plus de contrôle sur le traitement IA.
- Votre clé API : les messages sont envoyés au fournisseur (OpenAI, Anthropic, etc.). Vérifiez ses politiques de conservation. Début 2026, OpenAI indique ne pas entraîner par défaut sur les données API, et Anthropic applique une politique similaire. Les messages transitent néanmoins par leurs serveurs.
- Services gérés : le fournisseur traite les messages. Vérifiez sa politique de confidentialité et ses accords de traitement des données. Pour les entreprises traitant des données d’utilisateurs de l’UE, le RGPD compte. Quickchat AI, par exemple, traite les données dans l’UE et fournit un DPA aux clients professionnels.
Sur un serveur informel, la confidentialité n’est généralement pas la préoccupation principale. Pour une entreprise utilisant Discord comme assistance client, il est utile de savoir précisément où les conversations sont stockées et qui y accède.
Auto-hébergé ou géré : coût total de possession
Le coût de calcul ne raconte qu’une partie de l’histoire. Le coût total inclut le temps d’ingénierie.
Ce que vous développez avec un bot auto-hébergé :
- Code et déploiement du bot.
- Stockage de l’historique.
- Gestion de la fenêtre de contexte.
- Traitement des erreurs et supervision.
- Pipeline de base de connaissances / RAG, si nécessaire.
- Analyses et journalisation.
- Multicanal, si nécessaire.
Une estimation prudente pour un bot IA Discord prêt pour la production, avec historique, base de connaissances et analyses simples, est de 40 à 80 heures pour un développeur expérimenté. La maintenance des modèles, dépendances, débogages et supervision ajoute un travail continu.
Ce qu’un service géré fournit directement :
- Hébergement et gestion de disponibilité.
- Base de connaissances construite depuis votre site, vos documents et fichiers.
- Analyses de conversations : sentiment, thèmes et évaluations.
- Déploiement multicanal : le même agent sur Discord, le site, WhatsApp, Slack, etc.
- Transfert à des humains quand l’IA ne peut pas aider.
- AI Actions, appels API personnalisés déclenchés par le contexte, notamment des actions de modération comme l’exclusion temporaire, l’expulsion et le bannissement.
La question est de savoir si l’abonnement coûte moins que le coût d’opportunité de votre temps. Pour un développeur seul gérant un serveur de loisir, Ollama auto-hébergé est probablement adapté. Pour une entreprise qui utilise Discord en assistance client, le calcul favorise souvent un service géré : les fonctions autour du LLM, analyses, connaissances et transfert, rendent le bot utile. Le guide du bot IA de tickets construit cette combinaison de bout en bout sur l’offre gratuite, pour comparer à une solution concrète.
Récapitulatif
Il n’existe pas de bot IA gratuit Discord universellement « meilleur ». Le choix dépend de ce que « gratuit » signifie pour vous :
- Pour éviter des frais IA récurrents avec du matériel disponible, utilisez Ollama et un modèle open source auto-hébergé. Vous contrôlez le modèle et son traitement local, même si les messages passent par Discord. Vous renoncez à une partie de la qualité des modèles de pointe et prenez toute l’ingénierie en charge.
- Pour tester avec de vrais utilisateurs avant de payer, l’offre gratuite Quickchat AI permet de commencer sans carte. Discord y est inclus et les offres payantes démarrent à 9 $US/mois.
- Pour la qualité des meilleurs modèles et si vous savez gérer des clés API, un bot avec votre clé offre un faible coût par message, notamment avec GPT-4o mini ou Gemini Flash. Vous devez néanmoins héberger le code et créer les fonctions au-delà du chat brut.
- Pour les fonctions de production (base de connaissances, analyses, transfert, multicanal), le service géré est la voie la plus rapide. Évaluez selon votre volume attendu et vos besoins réels.
Le mot « gratuit » dans « bot IA gratuit Discord » recouvre beaucoup de choses. Le calcul a toujours un coût. La question est de savoir qui le paie et ce que vous obtenez ou abandonnez en échange.
Pour comparer toutes les options, pas seulement les gratuites, consultez Les meilleurs bots IA Discord en 2026. Si votre serveur est un canal d’assistance, Bot IA de tickets Discord explique comment répondre depuis les documents et transmettre le reste à des fils privés.