Bei der Suche nach einem kostenlosen AI Discord Bot findest du Dutzende Angebote. Manche sind tatsächlich kostenlos. Die meisten sind es zumindest nicht so, wie du vielleicht erwartest. Dieser Artikel erklärt verfügbare Optionen, ihre Grenzen und die tatsächlichen Kosten, sobald AI Inferenz ins Spiel kommt.
Warum kostenlose AI kompliziert ist
Ein LLM zu betreiben kostet Geld. Bei jeder Nachricht und Antwort bezahlt jemand die Rechenleistung. Bei gehosteten APIs wie OpenAI oder Anthropic erfolgt die Abrechnung pro Token. Bei einem eigenen Modell bezahlst du Hardware, Strom und Wartungszeit. Inferenz verursacht immer zusätzliche Kosten.
Bei einem kostenlosen AI Bot trifft daher mindestens einer dieser Fälle zu:
- Du bezahlst die Inferenz direkt, etwa über deinen eigenen API-Key.
- Der Dienst übernimmt die Kosten und finanziert sie durch kostenpflichtige Tarife, Werbung oder Datenerfassung.
- Du betreibst die Inferenz selbst mit einem Open-Source-Modell auf eigener Hardware.
- Der kostenlose Tarif begrenzt die Nutzung, damit die Rechenkosten des Anbieters überschaubar bleiben.
Welche Variante ein Bot verwendet, entscheidet darüber, ob er zu deinem Anwendungsfall passt.
Die drei Arten kostenloser AI Discord Bots
1. Selbst gehostete Open-Source-Bots: kostenlos, wenn du die Hardware stellst
Nur bei diesem Ansatz kontrolliert kein Drittanbieter deine Modell-Nutzungslimits. Du betreibst ein Open-Source-LLM lokal oder auf einem VPS, verbindest es über einen eigenen oder geforkten Bot mit Discord und kümmerst dich selbst um alles.
Typischer Aufbau:
- Ollama für den lokalen Modellbetrieb.
- discord.py oder discord.js für den Discord Bot.
- Ein Modell wie Llama 3.1 8B, Mistral 7B oder Gemma 2 9B.
Was du bekommst:
- Keine Kosten pro Nachricht außer Strom.
- Vollständige Kontrolle über Modell, System Prompt und Daten.
- Keine Nutzungslimits eines Modellanbieters. Discords eigene API-Limits gelten weiterhin.
- Lokale Inferenz: Für die Modellverarbeitung verlassen Nachrichten deinen Rechner nicht.
Was du dafür übernimmst:
- Du brauchst Hardware. Für ein Modell mit 7 Milliarden Parametern bei vernünftiger Geschwindigkeit benötigst du mindestens 8 GB GPU-Speicher oder einen modernen Mac mit gemeinsamem Arbeitsspeicher. CPU-Inferenz funktioniert, benötigt aber mehrere Sekunden pro Antwort.
- Du wartest die Infrastruktur: Updates, Neustarts, Monitoring und Speicherplatz für die Modellgewichte.
- Die Modellqualität liegt unter der von Spitzenmodellen. Llama 3.1 8B eignet sich für einfache Fragen und lockere Gespräche, erreicht bei komplexem Denken und längeren differenzierten Dialogen aber nicht GPT-4o oder Claude Sonnet.
- Wissensdatenbank, Analytics und Übergabe an Menschen fehlen. Benötigte Funktionen entwickelst du selbst.
Mindestanforderungen verbreiteter Modelle:
| Modell | Parameter | Benötigter GPU-Speicher | RAM bei CPU-Betrieb | Geschwindigkeit mit GPU |
|---|---|---|---|---|
| Gemma 2 2B | 2B | ~2 GB | ~4 GB | ~60 Tokens/Sekunde |
| Llama 3.1 8B | 8B | ~6 GB | ~10 GB | ~40 Tokens/Sekunde |
| Mistral 7B | 7B | ~6 GB | ~10 GB | ~40 Tokens/Sekunde |
| Llama 3.1 70B (Q4) | 70B | ~40 GB | ~48 GB | ~15 Tokens/Sekunde |
Die Geschwindigkeiten sind ungefähre Messwerte einer RTX 4090. Quantisierte Varianten benötigen weniger Speicher bei leicht geringerer Qualität.
2. Verwaltete Freemium-Dienste: kostenloser Tarif mit Grenzen
Hier betreibt ein Anbieter sowohl die AI als auch die Bot-Infrastruktur. Du konfigurierst den Bot im Web-Dashboard. Der kostenlose Tarif erlaubt begrenzte Nutzung; für mehr bezahlst du.
Beispiele:
| Dienst | Kostenloser Tarif | Nachrichtenlimit | Modellkontrolle | Discord-Unterstützung | Kreditkarte erforderlich |
|---|---|---|---|---|---|
| Quickchat AI | Kostenloser Tarif | Enthaltene Nutzung hängt vom Tarif ab | Anbieter verwaltet Spitzenmodelle | Ja, alle Tarife | Nein |
| MEE6 | Kostenloser Tarif | AI Funktionen nur in Premium | Anbieter verwaltet Modelle | Ja | Nicht für den kostenlosen Tarif |
| Botpress | Kostenloser Tarif | 2.000 eingehende Nachrichten/Monat | Konfigurierbar | Über Integration | Nein |
Mit dem kostenlosen Quickchat AI Tarif testest du ohne Kreditkarte. Discord ist in jedem Tarif enthalten. So kannst du deinen Bot mit echten Nutzern ausprobieren, bevor du dich festlegst. Die Verbindung erfolgt mit einem Klick: Öffne External Apps, wähle Discord, klicke auf Add to your Discord server und wähle deinen Server. Kostenpflichtige Tarife beginnen bei Starter für 9 $/Monat oder 8 $/Monat bei jährlicher Abrechnung.
Verwaltete Dienste liefern mehr als reine LLM Inferenz: Wissensdatenbanken aus Dokumenten und Websites, Gesprächsanalysen mit Stimmung und Themen, kanalübergreifenden Einsatz auf Website, WhatsApp, Slack und Discord sowie Übergabe an Menschen. Diese Funktionen selbst auf einem lokalen Modell aufzubauen ist ein umfangreiches Entwicklungsprojekt.
MEE6 ist vor allem ein Moderations- und Community-Bot. Seine AI Chat-Funktionen gehören zum Premium-Abonnement für 11,99 $/Monat, Stand Anfang 2026. Kostenlos sind Level, grundlegende Moderationsbefehle und Willkommensnachrichten, aber keine AI Gespräche.
Botpress bietet 2.000 eingehende Nachrichten pro Monat über alle Kanäle im kostenlosen Tarif. Ein visueller Flow-Builder und eigene LLM-Konfigurationen sind verfügbar. Für einen einfachen Discord Bot ist die Einrichtung jedoch komplexer als bei Quickchat, da Botpress auf strukturierte Gesprächsabläufe statt offenen Chat ausgerichtet ist.
3. Bots mit eigenem API-Key: Du bezahlst den LLM-Anbieter
Die dritte Gruppe besteht aus Open-Source-Bots, die auf einem Server laufen und eine kommerzielle API wie OpenAI, Anthropic oder Google aufrufen. Du hinterlegst deinen API-Key. Der Bot-Code ist kostenlos, die Modellnutzung wird pro Token abgerechnet.
Beispiele auf GitHub:
- GPT Discord Bot, das offizielle Beispiel von OpenAI.
- Verschiedene Community-Bots mit
discord.pyund dem OpenAI Python SDK.
Ungefähre Kosten kommerzieller APIs, Stand Anfang 2026:
| Modell | Eingabe pro 1 Mio. Tokens | Ausgabe pro 1 Mio. Tokens | Ungefähre Kosten pro Nachricht* |
|---|---|---|---|
| GPT-4o mini | 0,15 $ | 0,60 $ | ~0,0003 $ |
| GPT-4o | 2,50 $ | 10,00 $ | ~0,005 $ |
| Claude 3.5 Haiku | 0,80 $ | 4,00 $ | ~0,002 $ |
| Claude Sonnet 4 | 3,00 $ | 15,00 $ | ~0,007 $ |
| Gemini 2.0 Flash | 0,10 $ | 0,40 $ | ~0,0002 $ |
*Bei etwa 500 Eingabe- und 200 Ausgabe-Tokens pro Austausch, ohne Gesprächsverlauf. Mit Verlauf steigen die Eingabekosten linear mit der Kontextlänge.
Bei 1.000 Nachrichten pro Monat mit GPT-4o mini wären das etwa 0,30 $, bei 10.000 Nachrichten rund 3,00 $. Das wirkt wenig, bis du den Gesprächsverlauf einbeziehst: Mit beispielsweise 10 vorherigen Gesprächsrunden steigt die Eingabe von etwa 500 auf 5.000 Tokens pro Nachricht. Der entsprechende Eingabeaufwand verzehnfacht sich.
Kostenvergleich der Ansätze
Die folgende Tabelle schätzt monatliche Kosten bei unterschiedlichem Nachrichtenvolumen. Self-Hosting setzt einen kleinen VPS oder vorhandene Hardware voraus. Der API-Key-Ansatz verwendet GPT-4o mini als Referenz, der verwaltete Ansatz Quickchat AI.
| Nachrichten/Monat | Self-Hosting mit Ollama und VPS | Eigener API-Key mit GPT-4o mini | Verwaltet mit Quickchat AI |
|---|---|---|---|
| 100 | ~5-20 $ für VPS | ~0,03 $ | Kostenlos oder Starter für 9 $/Monat |
| 1.000 | ~5-20 $ für VPS | ~0,30-3,00 $ | Starter für 9 $ oder Basic für 29 $/Monat |
| 5.000 | ~15-40 $ für VPS | ~1,50-15,00 $ | Essential für 99 $ oder Professional für 299 $/Monat |
| 10.000 | ~30-80 $ für VPS | ~3,00-30,00 $ | Professional für 299 $ oder Business für 999 $/Monat |
| 35.000 | ~60-150 $ für VPS | ~10,50-105,00 $ | Business für 999 $/Monat oder Enterprise ab 0,50 $ pro Lösung |
Beim Self-Hosting hängt die Spanne davon ab, ob du einen günstigeren, langsameren CPU-VPS oder eine GPU-Instanz nutzt. CPU-VPS von Hetzner kosten etwa 5-10 $/Monat und können ein quantisiertes 7B-Modell mit Antwortzeiten von 5-15 Sekunden betreiben. GPU-Instanzen bei Lambda, RunPod oder Vast.ai beginnen ungefähr bei 0,20-0,50 $ pro Stunde. Im Dauerbetrieb sind das 150-360 $/Monat. Bei gelegentlicher Nutzung senken Spot-Instanzen oder Serverless-GPU-Anbieter die Kosten.
Die Spanne beim eigenen API-Key ergibt sich aus dem Gesprächsverlauf. Die Untergrenze gilt für einzelne Fragen ohne Verlauf, die Obergrenze für etwa 10 Kontextnachrichten.
Die verwaltete Spalte zeigt Quickchats Preise vom Juni 2026. Wissensdatenbank, Analytics und mehrere Kanäle sind enthalten. Bei den anderen Ansätzen erfordern sie zusätzliche Entwicklung.
Schneller Einstieg ins Self-Hosting: Python, discord.py und Ollama
Das folgende Minimalbeispiel verwendet Ollama für lokale Inferenz. Ollama muss installiert und gestartet sein, und du musst ein Modell herunterladen, etwa mit ollama pull llama3.1:8b.
Voraussetzungen
- Python 3.10+.
- Installiertes und laufendes Ollama:
curl -fsSL https://ollama.com/install.sh | sh. - Ein heruntergeladenes Modell:
ollama pull llama3.1:8b. - Ein Bot-Token aus dem Discord Developer Portal.
- Der Bot wurde dem Server mit
Send MessagesundRead Message Historyhinzugefügt.
Abhängigkeiten installieren
pip install discord.py aiohttp
Bot-Code
import discord
import aiohttp
import json
DISCORD_TOKEN = "your-bot-token-here"
OLLAMA_URL = "http://localhost:11434/api/chat"
MODEL = "llama3.1:8b"
SYSTEM_PROMPT = "You are a helpful assistant in a Discord server. Keep responses concise."
# Store conversation history per channel (in-memory, resets on restart)
conversations: dict[int, list[dict]] = {}
MAX_HISTORY = 10 # Keep last 10 messages per channel
intents = discord.Intents.default()
intents.message_content = True
client = discord.Client(intents=intents)
async def query_ollama(channel_id: int, user_message: str) -> str:
"""Send a message to Ollama and return the response."""
if channel_id not in conversations:
conversations[channel_id] = []
conversations[channel_id].append({"role": "user", "content": user_message})
# Trim history to avoid unbounded memory growth
if len(conversations[channel_id]) > MAX_HISTORY:
conversations[channel_id] = conversations[channel_id][-MAX_HISTORY:]
messages = [{"role": "system", "content": SYSTEM_PROMPT}] + conversations[channel_id]
payload = {
"model": MODEL,
"messages": messages,
"stream": False,
}
async with aiohttp.ClientSession() as session:
async with session.post(OLLAMA_URL, json=payload) as resp:
if resp.status != 200:
return f"Ollama returned status {resp.status}"
data = await resp.json()
reply = data["message"]["content"]
conversations[channel_id].append({"role": "assistant", "content": reply})
return reply
@client.event
async def on_ready():
print(f"Logged in as {client.user}")
@client.event
async def on_message(message: discord.Message):
# Ignore own messages
if message.author == client.user:
return
# Only respond when mentioned
if client.user not in message.mentions:
return
# Strip the mention from the message
content = message.content.replace(f"<@{client.user.id}>", "").strip()
if not content:
return
async with message.channel.typing():
reply = await query_ollama(message.channel.id, content)
# Discord has a 2000-character limit per message
if len(reply) > 2000:
for i in range(0, len(reply), 2000):
await message.reply(reply[i:i+2000])
else:
await message.reply(reply)
client.run(DISCORD_TOKEN)
Diese etwa 60 Codezeilen ergeben einen funktionsfähigen AI Bot, der auf Erwähnungen reagiert. Er speichert pro Kanal einen Gesprächsverlauf im Arbeitsspeicher, verliert ihn beim Neustart und berücksichtigt Discords Grenze von 2.000 Zeichen pro Nachricht.
Was diesem Minimal-Bot fehlt
Für Tests und kleine Server funktioniert der Code. Bei größerem Einsatz musst du typische Produktionsprobleme lösen:
- Dauerhafter Gesprächsverlauf: Das Dictionary im Arbeitsspeicher geht bei einem Neustart verloren. Ein produktiver Bot würde Redis oder eine Datenbank verwenden.
- Nutzungslimits: Discord erlaubt 5 Nachrichten pro 5 Sekunden und Kanal. Bei hoher Nutzung brauchst du Warteschlangen.
- Gleichzeitige Anfragen: Ollama verarbeitet standardmäßig eine Anfrage gleichzeitig. Mehrere Nutzer warten daher aufeinander. Du kannst mehrere Instanzen hinter einem Load Balancer betreiben oder
OLLAMA_NUM_PARALLELnutzen, verfügbar seit v0.1.33. - Fehlerbehandlung und Wiederholungen: Ollama kann abstürzen, zu wenig Speicher haben oder ungültige Antworten liefern. Der Bot muss damit umgehen können.
- Kontextverwaltung:
MAX_HISTORY = 10ist ein einfacher Ansatz. Besser ist es, Tokens zu zählen und den Verlauf an das Kontextfenster anzupassen. Bei Llama 3.1 8B sind hier standardmäßig 8.192 Tokens vorgesehen, konfigurierbar bis 128K bei nachlassender Qualität in langen Kontexten. - Threads: Bot-Gespräche finden häufig in Threads statt. Erstellung und eigener Verlauf pro Thread brauchen zusätzliche Logik.
- Wissensdatenbank und RAG: Für Antworten zur Projektdokumentation musst du Dokumente einbetten, Embeddings in einer Vektordatenbank speichern und relevante Abschnitte vor jeder LLM-Anfrage abrufen.
Technische Stolperstellen
Nutzungslimits der Discord API
Discord begrenzt Anfragen auf mehreren Ebenen:
- Pro Route: Jeder Endpunkt hat eigene Limits, sichtbar in
X-RateLimit-Limit,X-RateLimit-RemainingundX-RateLimit-Reset. - Global: 50 Anfragen pro Sekunde über alle Endpunkte.
- Pro Kanal: 5 Nachrichten pro 5 Sekunden.
- Gateway: 120 Ereignisse pro 60 Sekunden.
discord.py berücksichtigt die meisten Limits automatisch und stellt Anfragen in eine Warteschlange. Bei vielen Servern oder Kanälen kannst du dennoch das globale Limit erreichen. Dann ist Sharding relevant, also das Aufteilen von Server-Verbindungen auf mehrere Gateway-Verbindungen.
Verwendet dein Bot den zum Lesen von Text erforderlichen Intent MESSAGE_CONTENT, verlangt Discord ab mehr als 100 Servern eine Verifizierung. Dafür beschreibst du die Funktion des Bots und holst Discords Freigabe ein.
Abwägungen bei der Modellqualität
Der Abstand zwischen kleinen Open-Source-Modellen und kommerziellen Spitzenmodellen ist kleiner als vor zwei Jahren, aber weiterhin vorhanden. Ein grober Vergleich typischer Aufgaben:
| Aufgabe | Lokales Modell mit 7-8B Parametern | GPT-4o mini | GPT-4o / Claude Sonnet |
|---|---|---|---|
| Lockere Gespräche | Gut | Gut | Gut |
| Sachfragen | Mittel, mehr Halluzinationen | Gut | Sehr gut |
| Codegenerierung | Grundlegend | Gut | Sehr gut |
| Mehrsprachigkeit | Begrenzt | Gut | Sehr gut |
| Anweisungen befolgen | Mittel | Gut | Sehr gut |
| In der Rolle bleiben | Mittel | Gut | Gut |
Für lockere Gespräche und einfache Abfragen in einer Gaming-Community eignet sich ein lokales 8B-Modell gut. Im Kundensupport wird die geringere Genauigkeit problematisch. Charaktertreue hängt außerdem stark von der Einrichtung ab. Einen Roleplay AI Chatbot bauen, der in seiner Rolle bleibt zeigt, wie weit ein guter Persönlichkeits-Prompt und eine Wissensdatenbank mit Kanon auch ein Standardmodell bringen.
Kontextverwaltung
Dieser Aufwand wird bei Discord Bots oft unterschätzt. Nutzer schreiben viele kurze Nachrichten, und der Bot muss sich an frühere Aussagen erinnern.
Bei jeder Antwort muss er den bisherigen Verlauf im Prompt übergeben. Daraus folgt:
- Eingabe-Tokens wachsen linear mit der Gesprächslänge.
- Bei APIs steigen die entsprechenden Kosten ebenfalls linear.
- Bei lokalen Modellen wächst die Inferenzzeit mit dem Kontext. Die Attention-Berechnung wächst quadratisch, wobei Verfahren wie Flash Attention helfen.
- Irgendwann überschreitet das Gespräch das Kontextfenster. Dann musst du ältere Nachrichten abschneiden, zusammenfassen oder ein neues Gespräch beginnen.
Praktisch ist ein gleitendes Fenster der letzten N Nachrichten mit einer kurzen Zusammenfassung älterer Inhalte bei langen Gesprächen. Die Zusammenfassung braucht einen zusätzlichen LLM-Aufruf, begrenzt aber die Kosten pro Nachricht.
Datenschutz
Die Datenverarbeitung unterscheidet sich deutlich:
- Self-Hosting: Die Modellverarbeitung bleibt auf deiner Hardware. Du kontrollierst Aufbewahrung und Zugriff. Das bietet die stärkste Kontrolle über diese Verarbeitung.
- Eigener API-Key: Nachrichten werden an den API-Anbieter gesendet. Prüfe dessen Aufbewahrungsrichtlinien. Anfang 2026 erklärt OpenAI, API-Daten standardmäßig nicht zum Training zu verwenden; Anthropic verfolgt eine ähnliche Richtlinie. Die Nachrichten durchlaufen dennoch deren Server.
- Verwaltete Dienste: Der Anbieter verarbeitet Nachrichten. Prüfe Datenschutzerklärung und Auftragsverarbeitungsvertrag. Für Unternehmen mit EU-Nutzerdaten ist die DSGVO relevant. Quickchat AI verarbeitet beispielsweise Daten in der EU und bietet Geschäftskunden einen DPA.
Bei einem privaten Discord-Server steht Datenschutz häufig nicht im Vordergrund. Unternehmen mit einem Support-Bot sollten genau wissen, wo Gesprächsdaten gespeichert werden und wer darauf zugreifen kann.
Self-Hosting oder verwalteter Dienst: Gesamtkosten
Reine Rechenkosten zeigen nur einen Teil des Bildes. Zu den Gesamtkosten gehört auch Entwicklungszeit.
Was du beim Self-Hosting selbst baust:
- Bot-Code und Bereitstellung.
- Speicherung des Gesprächsverlaufs.
- Kontextverwaltung.
- Fehlerbehandlung und Monitoring.
- Wissensdatenbank und RAG-Pipeline, falls benötigt.
- Analytics und Protokollierung.
- Mehrere Kanäle, falls benötigt.
Für einen produktionsreifen AI Discord Bot mit Verlauf, Wissensdatenbank und grundlegenden Analytics benötigt ein erfahrener Entwickler konservativ geschätzt 40-80 Stunden. Modell- und Abhängigkeitsupdates, Fehlersuche und Monitoring verursachen anschließend weiteren Aufwand.
Was ein verwalteter Dienst mitbringt:
- Bot-Hosting und Verfügbarkeitsmanagement.
- Wissensdatenbank aus Website, Dokumentation und Dateien.
- Gesprächsanalysen zu Stimmung, Themen und Bewertungen.
- Einsatz desselben Agents auf Discord, Website, WhatsApp, Slack und weiteren Kanälen.
- Übergabe an Menschen, wenn die AI nicht helfen kann.
- AI Actions, also eigene API-Aufrufe aus dem Gesprächskontext, einschließlich Moderationsaktionen wie Timeout, Kick und Ban.
Entscheidend ist, ob der Monatspreis unter dem Wert deiner Entwicklungszeit liegt. Für ein Hobbyprojekt kann Ollama die richtige Wahl sein. Für ein Unternehmen mit Discord als Kundenkanal spricht die Rechnung häufig für einen verwalteten Dienst. Gerade Analytics, Wissensdatenbank und Übergabe machen den Bot nützlich. Die Anleitung zum AI Ticket Bot baut diese Kombination vollständig im kostenlosen Tarif auf. Damit kannst du die Alternative konkret vergleichen.
Zusammenfassung
Es gibt keinen universell besten kostenlosen AI Discord Bot. Die Wahl hängt davon ab, was kostenlos für dich bedeutet:
- Wenn du vorhandene Hardware nutzen und laufende Dienstgebühren vermeiden möchtest, hoste Ollama und ein Open-Source-Modell selbst. Du erhältst Kontrolle und lokale Datenverarbeitung, verzichtest auf Spitzenmodellqualität und übernimmst die Entwicklung.
- Wenn du vor einer Zahlung mit echten Nutzern testen möchtest, starte mit Quickchat AI ohne Kreditkarte. Discord funktioniert im kostenlosen Tarif; kostenpflichtige Tarife beginnen bei 9 $/Monat.
- Wenn du Spitzenmodellqualität möchtest und API-Keys selbst verwalten kannst, bietet ein eigener API-Key-Bot geringe Nachrichtenkosten, besonders mit GPT-4o mini oder Gemini Flash. Hosting und Funktionen über den reinen Chat hinaus bleiben deine Aufgabe.
- Wenn du Wissensdatenbank, Analytics, Übergabe und mehrere Kanäle benötigst, ist ein verwalteter Dienst der schnellste Weg. Vergleiche erwartetes Nachrichtenvolumen und benötigte Funktionen.
Hinter dem Wort kostenlos steckt bei AI Discord Bots eine wichtige Frage: Rechenleistung kostet immer etwas. Wer bezahlt sie, und welche Leistungen oder Einschränkungen erhältst du dafür?
Einen breiteren Vergleich findest du unter Die besten AI Discord Bots 2026. Für Support-Server zeigt AI Discord Ticket Bot, wie du Fragen aus deiner Dokumentation beantwortest und ungelöste Anliegen in private Ticket-Threads übergibst.