Darmowe boty AI na Discorda w 2026 roku

Jakub Swistak
Opublikowano Zaktualizowano 8 min czytania
Darmowe boty AI na Discorda: plany, limity wiadomości, kontrola modeli i własny hosting

Wyszukanie darmowego bota AI na Discorda daje dziesiątki wyników. Niektóre rzeczywiście są bezpłatne. Większość nie jest, przynajmniej w oczekiwanym znaczeniu. Ten artykuł pokazuje dostępne rozwiązania, kompromisy i rzeczywisty koszt bezpłatności przy generowaniu odpowiedzi przez AI.

Dlaczego darmowa AI jest skomplikowana

Uruchamianie LLM kosztuje. Za każdym razem, gdy użytkownik wysyła wiadomość i otrzymuje odpowiedź, ktoś płaci za obliczenia. API OpenAI czy Anthropic rozlicza tokeny. Własny model oznacza wydatki na sprzęt, prąd i utrzymanie. Wnioskowanie zawsze ma niezerowy koszt krańcowy.

Oferta darmowego bota AI oznacza więc jeden z przypadków:

  1. Sam płacisz za wnioskowanie, np. podając własny klucz API.
  2. Usługa pokrywa koszt, finansując go planami płatnymi, reklamami lub zbieraniem danych.
  3. Uruchamiasz model samodzielnie na własnym sprzęcie, używając open source.
  4. Darmowy plan ma niski limit, który ogranicza koszt obliczeń po stronie dostawcy.

Ustalenie, który przypadek dotyczy bota, jest podstawą oceny jego przydatności.

Trzy kategorie darmowych botów AI na Discorda

1. Samodzielnie hostowane boty open source: darmowe, gdy zapewniasz sprzęt

Tylko tutaj zewnętrzny dostawca nie kontroluje limitów modelu. Uruchamiasz otwarty LLM lokalnie lub na VPS, łączysz go z Discordem własnym albo zmodyfikowanym botem i samodzielnie obsługujesz cały system.

Typowy zestaw:

  • Ollama do lokalnego uruchamiania modeli.
  • discord.py lub discord.js do bota.
  • Model, np. Llama 3.1 8B, Mistral 7B albo Gemma 2 9B.

Co otrzymujesz:

  • Brak opłat za wiadomość poza energią.
  • Pełną kontrolę nad modelem, promptem i danymi.
  • Brak limitów narzuconych przez dostawcę modelu. Nadal obowiązują limity Discord API.
  • Lokalną obsługę modelu: przetwarzanie AI nie wymaga wysyłania wiadomości poza Twój komputer.

Z czego rezygnujesz i za co odpowiadasz:

  • Potrzebujesz sprzętu. Model 7B działający w rozsądnym tempie wymaga GPU z co najmniej 8 GB VRAM albo nowoczesnego Maca z pamięcią zunifikowaną. Na CPU też działa, ale odpowiedź zajmuje wiele sekund.
  • Utrzymujesz infrastrukturę: aktualizacje, restarty, monitoring i miejsce na wagi modeli.
  • Jakość jest niższa od modeli najwyższej klasy. Llama 3.1 8B radzi sobie z prostymi pytaniami i luźnymi rozmowami, ale nie dorównuje GPT-4o czy Claude Sonnet przy subtelnym rozumowaniu i złożonych dialogach.
  • Nie ma gotowej bazy wiedzy, analityki ani przekazania człowiekowi. Potrzebne funkcje budujesz samodzielnie.

Minimalne wymagania popularnych modeli:

ModelParametryWymagany VRAMRAM przy samym CPUTempo na GPU
Gemma 2 2B2B~2 GB~4 GB~60 tokenów/s
Llama 3.1 8B8B~6 GB~10 GB~40 tokenów/s
Mistral 7B7B~6 GB~10 GB~40 tokenów/s
Llama 3.1 70B (Q4)70B~40 GB~48 GB~15 tokenów/s

Prędkości są przybliżone i dotyczą RTX 4090. Warianty kwantyzowane zużywają mniej pamięci kosztem niewielkiej utraty jakości.

2. Zarządzane usługi freemium: darmowy plan z limitami

Dostawca hostuje AI i infrastrukturę bota. Ty konfigurujesz go w panelu internetowym. Darmowy plan daje ograniczone użycie, a za większe płacisz.

Przykłady:

UsługaDarmowy planLimit wiadomościKontrola modeluDiscordWymagana karta
Quickchat AIPlan darmowyZużycie zależne od planuDostawca zarządza modelami najwyższej klasyTak, każdy planNie
MEE6Plan darmowyAI tylko w premiumPo stronie dostawcyTakNie w planie darmowym
BotpressDarmowy pakiet2 000 wiadomości przychodzących/mies.KonfigurowalnyPrzez integracjęNie

Darmowy plan Quickchat AI pozwala testować bez karty. Discord jest dostępny w każdym planie, więc sprawdzisz bota z prawdziwymi użytkownikami przed zakupem. Połączenie wymaga jednego kliknięcia: w External Apps otwórz Discord, kliknij Add to your Discord server i wybierz serwer. Płatne plany zaczynają się od Starter za 9 USD miesięcznie lub 8 USD przy rozliczeniu rocznym.

Usługi zarządzane dają więcej niż samo generowanie odpowiedzi: bazę wiedzy z dokumentów i strony, analitykę rozmów z oceną nastroju i tematami, wdrożenie tego samego agenta na stronie, WhatsAppie, Slacku i Discordzie oraz przekazanie sprawy człowiekowi. Samodzielne zbudowanie tego na lokalnym modelu jest dużym projektem programistycznym.

MEE6 to przede wszystkim moderacja i aktywizacja społeczności. Czat AI wymaga subskrypcji premium, 11,99 USD miesięcznie według stanu na początek 2026 roku. Darmowo dostępne są poziomy, podstawowe komendy moderacji i powitania, ale nie rozmowy AI.

Botpress oferuje 2 000 wiadomości przychodzących miesięcznie łącznie we wszystkich kanałach. Ma wizualny edytor przepływów i własne konfiguracje LLM. Dla prostego bota Discord konfiguracja jest jednak bardziej złożona niż w Quickchat, ponieważ narzędzie skupia się na uporządkowanych procesach rozmowy zamiast otwartego czatu.

3. Boty z własnym kluczem API: płacisz dostawcy LLM

Trzecia kategoria to boty open source uruchamiane na serwerze, które generują odpowiedzi przez komercyjne API OpenAI, Anthropic, Google lub innych. Podajesz własny klucz. Kod bota jest darmowy, ale model rozlicza tokeny.

Przykłady na GitHubie:

  • GPT Discord Bot, oficjalny przykład OpenAI.
  • Boty społecznościowe z discord.py i OpenAI Python SDK.

Przybliżone ceny API na początku 2026 roku:

ModelWejście za 1 mln tokenówWyjście za 1 mln tokenówKoszt wiadomości*
GPT-4o mini0,15 USD0,60 USD~0,0003 USD
GPT-4o2,50 USD10,00 USD~0,005 USD
Claude 3.5 Haiku0,80 USD4,00 USD~0,002 USD
Claude Sonnet 43,00 USD15,00 USD~0,007 USD
Gemini 2.0 Flash0,10 USD0,40 USD~0,0002 USD

*Przy około 500 tokenach wejścia i 200 wyjścia na wymianę, bez historii. Historia zwiększa koszt wejścia liniowo wraz z długością kontekstu.

Tysiąc wiadomości miesięcznie z GPT-4o mini kosztuje około 0,30 USD, a 10 tys. około 3 USD. To małe kwoty, dopóki nie uwzględnisz historii. Dziesięć poprzednich tur może zwiększyć wejście z około 500 do 5 000 tokenów na wiadomość, dziesięciokrotnie zwiększając tę część kosztu.

Porównanie kosztów różnych podejść

Tabela szacuje koszty miesięczne przy różnych wolumenach. Własny hosting zakłada mały VPS lub posiadany sprzęt. Własny klucz używa cen GPT-4o mini, a usługa zarządzana cen Quickchat AI.

Wiadomości/mies.Własny hosting, Ollama i VPSWłasny klucz, GPT-4o miniUsługa zarządzana, Quickchat AI
100~5-20 USD za VPS~0,03 USDPlan darmowy lub Starter 9 USD/mies.
1 000~5-20 USD za VPS~0,30-3,00 USDStarter 9 USD lub Basic 29 USD/mies.
5 000~15-40 USD za VPS~1,50-15,00 USDEssential 99 USD lub Professional 299 USD/mies.
10 000~30-80 USD za VPS~3,00-30,00 USDProfessional 299 USD lub Business 999 USD/mies.
35 000~60-150 USD za VPS~10,50-105,00 USDBusiness 999 USD/mies. lub Enterprise od 0,50 USD za rozwiązanie

Zakres własnego hostingu zależy od użycia tańszego, wolniejszego CPU lub instancji GPU. Hetzner oferuje CPU VPS za około 5-10 USD miesięcznie, na którym kwantyzowany model 7B odpowiada w 5-15 sekund. GPU w Lambda, RunPod lub Vast.ai zaczyna się od około 0,20-0,50 USD za godzinę, czyli 150-360 USD miesięcznie przy pracy całodobowej. Przy okresowym użyciu koszty mogą zmniejszyć instancje spot lub serverless GPU.

Zakres ceny API wynika z historii: dolna granica oznacza pojedynczą turę, górna około 10 wiadomości kontekstu.

Kolumna zarządzana odpowiada cenom Quickchat z czerwca 2026 roku. Obejmuje bazę wiedzy, analitykę i wiele kanałów, które w pozostałych podejściach wymagają dodatkowej pracy.

Szybka konfiguracja własnego hostingu: Python, discord.py i Ollama

Poniższy minimalny przykład korzysta z lokalnego Ollama. Musi ono być zainstalowane, uruchomione i mieć pobrany model, np. przez ollama pull llama3.1:8b.

Wymagania

  1. Python 3.10+.
  2. Działające Ollama, instalowane przez curl -fsSL https://ollama.com/install.sh | sh.
  3. Model pobrany poleceniem ollama pull llama3.1:8b.
  4. Token bota z Discord Developer Portal.
  5. Bot dodany na serwer z Send Messages i Read Message History.

Instalacja zależności

pip install discord.py aiohttp

Kod bota

import discord
import aiohttp
import json

DISCORD_TOKEN = "your-bot-token-here"
OLLAMA_URL = "http://localhost:11434/api/chat"
MODEL = "llama3.1:8b"
SYSTEM_PROMPT = "You are a helpful assistant in a Discord server. Keep responses concise."

# Store conversation history per channel (in-memory, resets on restart)
conversations: dict[int, list[dict]] = {}
MAX_HISTORY = 10  # Keep last 10 messages per channel

intents = discord.Intents.default()
intents.message_content = True
client = discord.Client(intents=intents)


async def query_ollama(channel_id: int, user_message: str) -> str:
    """Send a message to Ollama and return the response."""
    if channel_id not in conversations:
        conversations[channel_id] = []

    conversations[channel_id].append({"role": "user", "content": user_message})

    # Trim history to avoid unbounded memory growth
    if len(conversations[channel_id]) > MAX_HISTORY:
        conversations[channel_id] = conversations[channel_id][-MAX_HISTORY:]

    messages = [{"role": "system", "content": SYSTEM_PROMPT}] + conversations[channel_id]

    payload = {
        "model": MODEL,
        "messages": messages,
        "stream": False,
    }

    async with aiohttp.ClientSession() as session:
        async with session.post(OLLAMA_URL, json=payload) as resp:
            if resp.status != 200:
                return f"Ollama returned status {resp.status}"
            data = await resp.json()
            reply = data["message"]["content"]

    conversations[channel_id].append({"role": "assistant", "content": reply})
    return reply


@client.event
async def on_ready():
    print(f"Logged in as {client.user}")


@client.event
async def on_message(message: discord.Message):
    # Ignore own messages
    if message.author == client.user:
        return

    # Only respond when mentioned
    if client.user not in message.mentions:
        return

    # Strip the mention from the message
    content = message.content.replace(f"<@{client.user.id}>", "").strip()
    if not content:
        return

    async with message.channel.typing():
        reply = await query_ollama(message.channel.id, content)

    # Discord has a 2000-character limit per message
    if len(reply) > 2000:
        for i in range(0, len(reply), 2000):
            await message.reply(reply[i:i+2000])
    else:
        await message.reply(reply)


client.run(DISCORD_TOKEN)

Około 60 wierszy kodu daje działającego bota reagującego na wzmianki. Zachowuje historię osobno dla kanałów w pamięci, traci ją po restarcie i obsługuje limit 2 000 znaków Discorda.

Czego brakuje w minimalnym bocie

Kod wystarcza do testów i małych serwerów. Przy większym wdrożeniu pojawiają się problemy wymagające rozwiązania:

  • Trwała historia: Słownik w pamięci znika po restarcie. Produkcja wymaga Redis lub bazy danych.
  • Limity: Discord dopuszcza 5 wiadomości na 5 sekund w kanale. Popularny bot potrzebuje kolejki.
  • Równoległe żądania: Ollama domyślnie przetwarza jedno naraz. Możesz uruchomić kilka instancji za load balancerem albo użyć OLLAMA_NUM_PARALLEL, dostępnego od v0.1.33.
  • Błędy i ponawianie: Ollama może się zatrzymać, wyczerpać pamięć lub zwrócić błędny format. Bot powinien obsłużyć te przypadki.
  • Kontekst: MAX_HISTORY = 10 jest uproszczeniem. Lepiej liczyć tokeny i przycinać do okna modelu. Dla Llama 3.1 8B opisany domyślny kontekst wynosi 8 192 tokeny, z konfiguracją do 128K i pogorszeniem jakości przy dłuższych kontekstach.
  • Wątki: Tworzenie wątków i oddzielna historia wymagają dodatkowej logiki.
  • Baza wiedzy i RAG: Odpowiedzi z dokumentacji wymagają embeddingów, bazy wektorowej i pobierania istotnych fragmentów przed wywołaniem LLM.

Techniczne pułapki

Limity Discord API

Limity działają na kilku poziomach:

  • Trasa: Każdy endpoint ma własne limity zwracane w X-RateLimit-Limit, X-RateLimit-Remaining i X-RateLimit-Reset.
  • Globalny: 50 żądań na sekundę.
  • Kanał: 5 wiadomości na 5 sekund.
  • Gateway: 120 zdarzeń na 60 sekund.

discord.py automatycznie obsługuje większość limitów przez kolejkowanie. Przy wielu serwerach i kanałach nadal można osiągnąć globalny limit. Wtedy warto rozważyć sharding, czyli rozdzielenie połączeń serwerów między kilka połączeń Gateway.

Bot korzystający z MESSAGE_CONTENT, potrzebnego do czytania tekstu, wymaga weryfikacji Discorda po przekroczeniu 100 serwerów. Proces obejmuje opis działania i uzyskanie zgody.

Kompromisy jakości modeli

Luka między małymi modelami otwartymi a komercyjnymi modelami najwyższej klasy zmalała względem sytuacji sprzed dwóch lat, ale nadal istnieje. Przybliżone porównanie:

ZadanieLokalny model 7-8BGPT-4o miniGPT-4o / Claude Sonnet
Luźna rozmowaDobrzeDobrzeDobrze
Pytania o faktyŚrednio, więcej halucynacjiDobrzeBardzo dobrze
Generowanie koduPodstawowoDobrzeBardzo dobrze
Wiele językówOgraniczoneDobrzeBardzo dobrze
Przestrzeganie instrukcjiŚrednioDobrzeBardzo dobrze
Pozostawanie w roliŚrednioDobrzeDobrze

Dla społeczności graczy z luźnym czatem i prostymi zapytaniami lokalny model 8B jest wystarczający. We wsparciu klienta różnica dokładności staje się problemem. Spójność postaci zależy też od konfiguracji: poradnik chatbota roleplay pozostającego w roli pokazuje znaczenie promptu i bazy kanonu nawet dla zwykłego modelu.

Zarządzanie oknem kontekstowym

To często niedoceniany problem. Na Discordzie użytkownicy wysyłają wiele krótkich wiadomości, a bot musi pamiętać wcześniejsze wypowiedzi.

Każda odpowiedź wymaga dodania historii do promptu, co oznacza:

  • Liniowy wzrost tokenów wejścia z długością rozmowy.
  • Liniowy wzrost odpowiadających im kosztów API.
  • Wzrost czasu lokalnego wnioskowania z kontekstem. Obliczenia attention są kwadratowe, choć optymalizacje takie jak Flash Attention pomagają.
  • Konieczność przycięcia początku, streszczenia starszych wiadomości lub nowej rozmowy po przekroczeniu okna.

Praktyczne rozwiązanie to przesuwne okno ostatnich N wiadomości z krótkim podsumowaniem starszego kontekstu. Podsumowanie wymaga dodatkowego wywołania LLM, ale ogranicza koszty kolejnych wiadomości.

Konsekwencje dla prywatności

Zależą od podejścia:

  • Własny hosting: Przetwarzanie przez model pozostaje na Twoim sprzęcie. Kontrolujesz przechowywanie i dostęp. To największa kontrola nad tą częścią przetwarzania.
  • Własny klucz API: Wiadomości trafiają do OpenAI, Anthropic lub innego dostawcy. Sprawdź retencję. Na początku 2026 roku OpenAI deklaruje brak domyślnego treningu na danych API, a Anthropic podobną politykę. Dane i tak przechodzą przez ich serwery.
  • Usługi zarządzane: Dostawca przetwarza wiadomości. Sprawdź politykę prywatności i umowy przetwarzania. Dla firm obsługujących dane osób z UE ważne jest RODO. Quickchat AI przetwarza dane w UE i udostępnia klientom biznesowym DPA.

Na prywatnym serwerze ten temat często nie jest najważniejszy. Firma korzystająca z Discorda do wsparcia powinna jednak wiedzieć, gdzie przechowywane są rozmowy i kto ma dostęp.

Własny hosting a usługa zarządzana: całkowity koszt

Cena obliczeń jest tylko częścią obrazu. Całkowity koszt obejmuje czas programistów.

Co budujesz samodzielnie:

  • Kod i wdrożenie bota.
  • Trwałą historię rozmów.
  • Zarządzanie kontekstem.
  • Błędy i monitoring.
  • Bazę wiedzy i RAG, jeśli potrzebne.
  • Analitykę i logi.
  • Obsługę wielu kanałów, jeśli potrzebna.

Doświadczony programista potrzebuje ostrożnie szacowanych 40-80 godzin na produkcyjnego bota z historią, wiedzą i podstawową analityką. Aktualizacje modeli i zależności, debugowanie i monitoring wymagają dalszego czasu.

Co dostajesz w usłudze zarządzanej:

  • Hosting i zarządzanie dostępnością.
  • Bazę wiedzy z witryny, dokumentów i plików.
  • Analitykę nastroju, tematów i ocen rozmów.
  • Tego samego agenta na Discordzie, stronie, WhatsAppie, Slacku i innych kanałach.
  • Przekazanie człowiekowi, gdy AI nie może pomóc.
  • AI Actions uruchamiające własne API z kontekstu, w tym moderację timeout, kick i ban.

Porównaj miesięczny koszt usługi z wartością czasu programistów. Dla hobbystycznego serwera własne Ollama może być właściwe. Dla biznesowego kanału obsługi zwykle korzystniejsza jest usługa zarządzana, ponieważ wiedza, analityka i przekazanie człowiekowi czynią bota użytecznym. Poradnik bota zgłoszeń AI buduje tę kombinację w darmowym planie, dając konkretną podstawę porównania.

Podsumowanie

Nie istnieje jeden najlepszy darmowy bot AI. Wybór zależy od znaczenia bezpłatności:

  • Jeśli masz sprzęt i chcesz uniknąć stałych opłat za usługę, hostuj Ollama i model open source. Zyskasz kontrolę i lokalną obsługę danych, lecz niższą jakość niż w czołowych modelach i pełną odpowiedzialność techniczną.
  • Jeśli chcesz przetestować prawdziwych użytkowników przed płaceniem, Quickchat AI oferuje darmowy plan bez karty i z Discordem. Płatne plany zaczynają się od 9 USD miesięcznie.
  • Jeśli potrzebujesz jakości czołowych modeli i umiesz zarządzać kluczami, własny bot API daje niskie koszty wiadomości, zwłaszcza z GPT-4o mini lub Gemini Flash. Nadal odpowiadasz za hosting i funkcje poza czatem.
  • Jeśli potrzebujesz wiedzy, analityki, przekazania i wielu kanałów, najszybsza jest usługa zarządzana. Oceniaj ją według wolumenu i potrzebnych funkcji.

Określenie darmowy bot AI kryje istotne pytanie. Obliczenia zawsze kosztują. Kto za nie płaci i co otrzymujesz lub oddajesz w zamian?

Szersze porównanie zawiera zestawienie najlepszych botów AI na Discorda w 2026 roku. Dla serwerów wsparcia bot zgłoszeń AI pokazuje odpowiedzi z dokumentacji i eskalację do prywatnych wątków.