Bots de IA gratuitos para Discord em 2026

Jakub Swistak
Publicado em Atualizado em 11 min de leitura
Bots de IA gratuitos para Discord: planos, limites de mensagens, controle de modelos e hospedagem própria

Ao pesquisar “bot de IA gratuito para Discord”, você encontra dezenas de opções. Algumas são de fato gratuitas. A maioria não é, pelo menos não da maneira que você espera. Este artigo explica o que está disponível, quais são as limitações e quanto o “gratuito” realmente custa quando há inferência de IA envolvida.

Por que “IA gratuita” é complicado

Executar um LLM custa dinheiro. Toda vez que alguém envia uma mensagem e recebe uma resposta, alguém paga pelo processamento. Em APIs hospedadas, como OpenAI e Anthropic, você paga por token. Em modelos de hospedagem própria, paga em hardware, eletricidade e tempo de manutenção. Não há como escapar: a inferência tem um custo marginal diferente de zero.

Quando um serviço oferece um “bot de IA gratuito”, uma destas situações se aplica:

  1. Você paga diretamente pela inferência, por exemplo, fornecendo sua chave de API.
  2. O serviço absorve o custo e o recupera com planos pagos, anúncios ou coleta de dados.
  3. Você executa a inferência no seu próprio hardware com um modelo de código aberto.
  4. O plano gratuito tem um limite baixo, que restringe a exposição do provedor aos custos computacionais.

Entender qual dessas situações se aplica a cada bot é essencial para avaliar se ele atende ao seu caso de uso.

As três categorias de bots de IA gratuitos para Discord

1. Bots de código aberto com hospedagem própria (gratuitos, você fornece o hardware)

Essa é a única opção em que nenhum terceiro controla seus limites de uso da IA. Você executa um LLM de código aberto localmente ou em um VPS, conecta-o ao Discord com um bot que escreve ou adapta e cuida de tudo.

Stack típica:

  • Ollama para servir modelos locais.
  • discord.py ou discord.js para o bot do Discord.
  • Um modelo como Llama 3.1 8B, Mistral 7B ou Gemma 2 9B.

O que você ganha:

  • Nenhum custo por mensagem além da eletricidade.
  • Controle total sobre o modelo, o prompt de sistema e os dados.
  • Nenhum limite imposto por um provedor de IA, apenas os limites da própria API do Discord.
  • Processamento do modelo no seu próprio hardware, sem enviar as mensagens a um provedor externo de LLM. As mensagens ainda passam pelo Discord.

Do que você abre mão:

  • Você precisa de hardware. Executar um modelo de 7 bilhões de parâmetros em velocidade razoável exige uma GPU com pelo menos 8 GB de VRAM ou um Mac moderno com memória unificada. A inferência em CPU funciona, mas é lenta, com vários segundos por resposta para um modelo 7B.
  • Você mantém a infraestrutura. Atualizações, reinicializações, monitoramento e espaço em disco para os pesos do modelo ficam por sua conta.
  • A qualidade é inferior à dos modelos de ponta. O Llama 3.1 8B é competente, mas não é GPT-4o nem Claude Sonnet. Funciona bem para perguntas simples e conversas casuais; fica atrás em raciocínio sutil ou diálogos complexos com várias interações.
  • Não há base de conhecimento, análises ou transferência humana integradas. Você desenvolve o que precisar.

Requisitos mínimos de hardware para modelos comuns:

ModeloParâmetrosVRAM necessáriaRAM em CPUVelocidade de resposta em GPU
Gemma 2 2B2 bilhões~2 GB~4 GB~60 tokens/s
Llama 3.1 8B8 bilhões~6 GB~10 GB~40 tokens/s
Mistral 7B7 bilhões~6 GB~10 GB~40 tokens/s
Llama 3.1 70B (Q4)70 bilhões~40 GB~48 GB~15 tokens/s

(Velocidades aproximadas, medidas em uma RTX 4090. Variantes quantizadas usam menos memória com uma pequena perda de qualidade.)

2. Serviços gerenciados freemium (plano gratuito com limites)

Nesses produtos, outra empresa hospeda a IA e a infraestrutura do bot. Você configura tudo em um painel web. O plano gratuito oferece uso limitado; para usar mais, você paga.

Exemplos:

ServiçoPlano gratuitoLimite de mensagensControle do modeloSuporte ao DiscordExige cartão
Quickchat AIPlano gratuitoUso incluído varia por planoGerenciado pelo provedor (modelos de ponta)Sim, em todos os planosNão
MEE6Plano gratuitoIA apenas no PremiumGerenciado pelo provedorSimNão no plano gratuito
BotpressPlano gratuito2.000 mensagens recebidas/mêsConfigurávelPor integraçãoNão

O plano gratuito do Quickchat AI permite testar sem cartão de crédito. A integração com Discord está disponível em todos os planos, então você pode conectar o bot e testá-lo com usuários reais antes de contratar. A conexão leva um clique: em External Apps, abra Discord, clique em Add to your Discord server e escolha o servidor. Os planos pagos começam no Starter por US$ 9/mês ou US$ 8/mês com cobrança anual.

A principal vantagem dos serviços gerenciados são os recursos além da inferência: bases de conhecimento feitas com seus documentos e site, análises de conversas (sentimento e temas), publicação multicanal (o mesmo agente no site, WhatsApp, Slack e Discord) e transferência para pessoas quando a IA não resolve. Criar tudo isso do zero sobre um modelo próprio é um projeto considerável de engenharia.

O MEE6 é principalmente um bot de moderação e engajamento. O chat com IA exige assinatura Premium (US$ 11,99/mês no início de 2026). O plano gratuito inclui níveis, comandos básicos de moderação e boas-vindas, mas não conversas com IA.

O Botpress tem um plano gratuito com 2.000 mensagens recebidas por mês entre todos os canais. Oferece construtor visual de fluxos e configurações de LLM personalizadas. Porém, a configuração é mais complexa que no Quickchat para um bot simples de Discord, pois o Botpress prioriza fluxos estruturados em vez de conversas abertas.

3. Bots com sua própria chave de API (você paga ao provedor do LLM)

A terceira categoria reúne bots de código aberto que rodam em um servidor, mas chamam uma API comercial (OpenAI, Anthropic, Google etc.) para inferência. Você fornece sua chave. O código do bot é gratuito, mas você paga por token ao provedor.

Exemplos no GitHub:

  • GPT Discord Bot, exemplo oficial da OpenAI.
  • Vários bots da comunidade feitos com discord.py e o SDK Python da OpenAI.

Custo por mensagem com APIs comerciais (aproximado, no início de 2026):

ModeloEntrada por 1 milhão de tokensSaída por 1 milhão de tokensCusto aproximado por mensagem*
GPT-4o miniUS$ 0,15US$ 0,60~US$ 0,0003
GPT-4oUS$ 2,50US$ 10,00~US$ 0,005
Claude 3.5 HaikuUS$ 0,80US$ 4,00~US$ 0,002
Claude Sonnet 4US$ 3,00US$ 15,00~US$ 0,007
Gemini 2.0 FlashUS$ 0,10US$ 0,40~US$ 0,0002

*Considerando cerca de 500 tokens de entrada e 200 de saída por troca de mensagens, sem histórico. Ao incluir histórico, o custo de entrada cresce linearmente com o tamanho do contexto.

Com 1.000 mensagens mensais usando GPT-4o mini, você gastaria aproximadamente US$ 0,30. Com 10.000, cerca de US$ 3,00. Esses números parecem pequenos até incluir o histórico: se cada mensagem leva todo o contexto da conversa, por exemplo 10 interações anteriores, os tokens de entrada saltam de aproximadamente 500 para 5.000. O custo de entrada aumenta dez vezes, elevando também o custo total.

Comparação de custos entre abordagens

A tabela estima custos mensais em diferentes volumes. “Hospedagem própria” considera um VPS pequeno ou hardware existente. “Sua chave de API” usa os preços do GPT-4o mini. “Gerenciado” usa o Quickchat AI como referência.

Mensagens mensaisHospedagem própria (Ollama + VPS)Sua chave de API (GPT-4o mini)Gerenciado (Quickchat AI)
100~US$ 5 a 20 (VPS)~US$ 0,03Plano gratuito ou Starter por US$ 9/mês
1.000~US$ 5 a 20 (VPS)~US$ 0,30 a 3,00Starter por US$ 9/mês ou Basic por US$ 29/mês
5.000~US$ 15 a 40 (VPS)~US$ 1,50 a 15,00Essential por US$ 99/mês ou Professional por US$ 299/mês
10.000~US$ 30 a 80 (VPS)~US$ 3,00 a 30,00Professional por US$ 299/mês ou Business por US$ 999/mês
35.000~US$ 60 a 150 (VPS)~US$ 10,50 a 105,00Business por US$ 999/mês ou Enterprise a partir de US$ 0,50/resolução

Sobre a coluna de hospedagem própria: a faixa depende de usar VPS apenas com CPU, mais barato e lento, ou uma instância com GPU. A Hetzner oferece VPS com CPU por cerca de US$ 5 a 10/mês capazes de executar um modelo 7B quantizado, embora as respostas levem de 5 a 15 segundos. Instâncias GPU em nuvem, como Lambda, RunPod ou Vast.ai, começam perto de US$ 0,20 a 0,50/h por GPU, equivalentes a US$ 150 a 360/mês funcionando sem parar. Para uso intermitente, instâncias spot ou provedores de GPU serverless podem reduzir o valor.

A coluna de chave própria mostra uma faixa porque o custo depende muito de incluir histórico em cada requisição. O mínimo considera uma única interação, sem histórico; o máximo considera várias interações com cerca de 10 mensagens de contexto.

A coluna gerenciada reflete os preços do Quickchat em junho de 2026. Esses planos incluem gestão da base de conhecimento, análises e suporte multicanal, ausentes nas outras abordagens sem trabalho adicional de engenharia.

Configuração rápida com hospedagem própria: Python + discord.py + Ollama

Abaixo há um exemplo mínimo funcional de bot do Discord com Ollama para inferência local. É necessário ter o Ollama instalado e em execução e um modelo baixado, por exemplo com ollama pull llama3.1:8b.

Pré-requisitos

  1. Python 3.10 ou superior.
  2. Ollama instalado e em execução (curl -fsSL https://ollama.com/install.sh | sh).
  3. Um modelo baixado: ollama pull llama3.1:8b.
  4. Token de bot do Discord, criado no Discord Developer Portal.
  5. Bot adicionado ao servidor com as permissões Send Messages e Read Message History.

Instale as dependências

pip install discord.py aiohttp

Código do bot

import discord
import aiohttp
import json

DISCORD_TOKEN = "your-bot-token-here"
OLLAMA_URL = "http://localhost:11434/api/chat"
MODEL = "llama3.1:8b"
SYSTEM_PROMPT = "You are a helpful assistant in a Discord server. Keep responses concise."

# Store conversation history per channel (in-memory, resets on restart)
conversations: dict[int, list[dict]] = {}
MAX_HISTORY = 10  # Keep last 10 messages per channel

intents = discord.Intents.default()
intents.message_content = True
client = discord.Client(intents=intents)


async def query_ollama(channel_id: int, user_message: str) -> str:
    """Send a message to Ollama and return the response."""
    if channel_id not in conversations:
        conversations[channel_id] = []

    conversations[channel_id].append({"role": "user", "content": user_message})

    # Trim history to avoid unbounded memory growth
    if len(conversations[channel_id]) > MAX_HISTORY:
        conversations[channel_id] = conversations[channel_id][-MAX_HISTORY:]

    messages = [{"role": "system", "content": SYSTEM_PROMPT}] + conversations[channel_id]

    payload = {
        "model": MODEL,
        "messages": messages,
        "stream": False,
    }

    async with aiohttp.ClientSession() as session:
        async with session.post(OLLAMA_URL, json=payload) as resp:
            if resp.status != 200:
                return f"Ollama returned status {resp.status}"
            data = await resp.json()
            reply = data["message"]["content"]

    conversations[channel_id].append({"role": "assistant", "content": reply})
    return reply


@client.event
async def on_ready():
    print(f"Logged in as {client.user}")


@client.event
async def on_message(message: discord.Message):
    # Ignore own messages
    if message.author == client.user:
        return

    # Only respond when mentioned
    if client.user not in message.mentions:
        return

    # Strip the mention from the message
    content = message.content.replace(f"<@{client.user.id}>", "").strip()
    if not content:
        return

    async with message.channel.typing():
        reply = await query_ollama(message.channel.id, content)

    # Discord has a 2000-character limit per message
    if len(reply) > 2000:
        for i in range(0, len(reply), 2000):
            await message.reply(reply[i:i+2000])
    else:
        await message.reply(reply)


client.run(DISCORD_TOKEN)

São cerca de 60 linhas que produzem um bot de IA funcional, respondendo quando mencionado. Ele mantém o histórico por canal em memória, perdido ao reiniciar, e lida com o limite de 2.000 caracteres por mensagem do Discord.

O que falta nesse bot mínimo

O código funciona para testes e servidores pequenos. Além disso, você encontrará questões que bots em produção precisam resolver:

  • Histórico persistente. O dicionário em memória se perde ao reiniciar o processo. Um bot de produção armazenaria as conversas em Redis ou em um banco de dados.
  • Limites de requisições. O Discord permite 5 mensagens a cada 5 segundos por canal. Se o bot ficar popular, precisará de filas.
  • Requisições simultâneas. Por padrão, o Ollama processa uma por vez. Vários usuários ao mesmo tempo formam uma fila. Você pode usar várias instâncias atrás de um balanceador ou a opção OLLAMA_NUM_PARALLEL, disponível desde a versão 0.1.33.
  • Tratamento de erros e novas tentativas. O Ollama pode falhar, ficar sem memória ou retornar respostas malformadas. O bot deve lidar adequadamente com tudo isso.
  • Gerenciamento do contexto. MAX_HISTORY = 10 é uma estratégia simples demais. É melhor contar tokens e cortar o histórico para caber na janela do modelo (8.192 tokens por padrão no Llama 3.1 8B, configurável até 128 mil, com perda de qualidade em contextos maiores).
  • Suporte a threads. Conversas com bots frequentemente acontecem em threads. Criá-las e manter histórico por thread exige lógica adicional.
  • Base de conhecimento / RAG. Para responder sobre a documentação do projeto, você precisa de geração aumentada por recuperação: criar embeddings dos documentos, armazená-los em um banco vetorial e recuperar trechos relevantes antes de enviá-los ao LLM.

Armadilhas técnicas

Limites da API do Discord

O Discord impõe limites em vários níveis:

  • Por rota: cada endpoint tem seu limite, informado nos cabeçalhos X-RateLimit-Limit, X-RateLimit-Remaining e X-RateLimit-Reset.
  • Global: 50 requisições por segundo entre todos os endpoints.
  • Mensagens por canal: 5 mensagens a cada 5 segundos por canal.
  • Gateway: 120 eventos a cada 60 segundos.

A biblioteca discord.py administra a maioria automaticamente, colocando requisições na fila quando um limite é atingido. Porém, se o bot atua em muitos servidores ou canais simultaneamente, ainda pode atingir o limite global. Nesse caso, é preciso estudar sharding, dividindo as conexões aos servidores entre várias conexões ao gateway.

Para bots com o intent MESSAGE_CONTENT, necessário para ler texto, o Discord exige verificação quando estão em mais de 100 servidores. Isso envolve enviar uma descrição do bot e obter aprovação do Discord.

Compromissos de qualidade do modelo

A distância entre modelos pequenos de código aberto e modelos comerciais de ponta diminuiu nos últimos dois anos, mas ainda existe. Uma comparação aproximada para tarefas comuns:

TarefaModelo local de 7 a 8 bilhõesGPT-4o miniGPT-4o / Claude Sonnet
Conversa casualBomBomBom
Perguntas factuaisModerado, com mais alucinaçõesBomMuito bom
Geração de códigoBásicoBomMuito bom
Vários idiomasLimitadoBomMuito bom
Seguimento de instruçõesModeradoBomMuito bom
Manter o personagemModeradoBomBom

Para comunidades de jogos com conversa casual e consultas simples, um modelo local 8B funciona bem. Para atendimento ao cliente, em que precisão importa, a diferença de qualidade vira um problema real. Manter o personagem também depende muito da configuração: como criar um chatbot de IA para roleplay que mantém o personagem mostra o alcance de um prompt de personalidade e uma base de conhecimento canônica, mesmo com um modelo comum.

Gerenciamento da janela de contexto

Esse é o desafio técnico mais subestimado dos bots do Discord. As conversas têm várias interações: os usuários enviam muitas mensagens curtas, e o bot precisa lembrar o que foi dito antes.

A cada resposta, é necessário incluir o histórico no prompt. Isso significa:

  • Os tokens de entrada crescem linearmente com o tamanho da conversa.
  • Em bots com API, o custo também cresce linearmente.
  • Em modelos locais, o tempo de inferência aumenta com o contexto (quadraticamente no cálculo de atenção, embora otimizações como Flash Attention ajudem).
  • Em algum momento, a conversa supera a janela do modelo. Você precisa cortar o início, resumir mensagens antigas ou começar uma nova conversa.

Uma solução prática é manter uma janela móvel das últimas N mensagens e, em conversas longas, acrescentar antes um resumo curto do contexto anterior. Isso exige uma chamada extra ao LLM para gerar o resumo, mas mantém o custo por mensagem limitado.

Implicações de privacidade

Elas variam bastante conforme a abordagem:

  • Hospedagem própria: o processamento do LLM permanece no seu hardware. Você controla a retenção e o acesso nessa parte, mas o Discord continua transportando as mensagens. É a opção com maior controle sobre o processamento da IA.
  • Sua chave de API: as mensagens são enviadas ao provedor (OpenAI, Anthropic etc.). Confira as políticas de retenção. No início de 2026, a OpenAI afirma que não treina com dados de API por padrão, e a Anthropic tem política semelhante. Ainda assim, as mensagens passam pelos servidores dessas empresas.
  • Serviços gerenciados: o provedor processa as mensagens. Confira a política de privacidade e os acordos de tratamento de dados. Para empresas que tratam dados de usuários na União Europeia, o GDPR é relevante. O Quickchat AI, por exemplo, processa dados na UE e oferece um DPA para clientes empresariais.

Em um servidor casual, privacidade costuma não ser a preocupação principal. Para uma empresa que atende clientes pelo Discord, convém entender exatamente onde as conversas ficam armazenadas e quem pode acessá-las.

Hospedagem própria ou serviço gerenciado: custo total

Comparar apenas processamento conta só parte da história. O custo total inclui tempo de engenharia.

O que você desenvolve em um bot próprio:

  • Código e implantação do bot.
  • Armazenamento do histórico.
  • Gerenciamento da janela de contexto.
  • Tratamento de erros e monitoramento.
  • Pipeline de base de conhecimento / RAG, se necessário.
  • Análises e logs.
  • Suporte multicanal, se necessário.

Em uma estimativa conservadora, criar um bot de IA para Discord pronto para produção com histórico, base de conhecimento e análises básicas exige de 40 a 80 horas de um desenvolvedor experiente. Manter modelos, dependências, depuração e monitoramento acrescenta trabalho contínuo.

O que um serviço gerenciado entrega pronto:

  • Hospedagem e gestão de disponibilidade.
  • Base de conhecimento feita com seu site, documentação e arquivos.
  • Análises de conversas (sentimento, temas e avaliações).
  • Publicação multicanal: o mesmo agente no Discord, site, WhatsApp, Slack etc.
  • Transferência para pessoas quando a IA não consegue ajudar.
  • AI Actions, chamadas personalizadas de API acionadas pelo contexto, incluindo ações de moderação como timeout, expulsão e banimento.

A questão é se a mensalidade é menor que o custo de oportunidade do seu tempo de engenharia. Para um desenvolvedor individual com servidor por hobby, hospedar com Ollama provavelmente faz sentido. Para empresas que usam o Discord como suporte ao cliente, o cálculo costuma favorecer um serviço gerenciado: os recursos ao redor do LLM, como análises, conhecimento e transferência, tornam o bot útil. O guia de bot de tickets com IA monta essa combinação completa no plano gratuito, permitindo comparar com uma alternativa concreta.

Resumo

Não existe um bot de IA gratuito universalmente “melhor” para Discord. A escolha depende do significado de “gratuito” para você:

  • Para evitar cobrança contínua de IA e aproveitar hardware disponível, hospede com Ollama e um modelo de código aberto. Você controla o modelo e o processamento local, embora as mensagens passem pelo Discord. Abre mão de qualidade em relação aos modelos de ponta e assume toda a engenharia.
  • Para testar com usuários reais antes de pagar, o plano gratuito do Quickchat AI permite começar sem cartão. A integração com Discord funciona nele, e os planos pagos começam em US$ 9/mês.
  • Para ter qualidade de ponta e administrar suas chaves de API, um bot com chave própria oferece baixo custo por mensagem, especialmente com GPT-4o mini ou Gemini Flash. Você ainda hospeda o código e constrói recursos além do chat básico.
  • Para recursos de produção (base de conhecimento, análises, transferência e multicanal), o serviço gerenciado é o caminho mais rápido. Avalie conforme o volume esperado e os recursos necessários.

A palavra “gratuito” em “bot de IA gratuito para Discord” cobre muita coisa. O processamento sempre custa algo. A pergunta é quem paga e o que você recebe ou deixa de receber em troca.

Para uma comparação mais ampla, além das opções gratuitas, veja Melhores bots de IA para Discord em 2026. Se seu servidor é especificamente um canal de suporte, Bot de tickets com IA para Discord mostra como responder com a documentação e encaminhar o restante para threads privadas.