Bots de IA gratuitos para Discord en 2026

Jakub Swistak
Publicado Actualizado 11 min de lectura
Bots de IA gratuitos para Discord: planes, límites de mensajes, control de modelos y alojamiento propio

Si buscas “bot de IA gratuito para Discord”, encontrarás decenas de opciones. Algunas son realmente gratuitas. La mayoría no lo son, al menos como podrías esperar. Este artículo explica qué hay disponible, cuáles son las contrapartidas y cuánto cuesta de verdad lo “gratuito” cuando interviene la inferencia de IA.

Por qué la “IA gratuita” es complicada

Ejecutar un LLM cuesta dinero. Cada vez que un usuario envía un mensaje y recibe una respuesta, alguien paga el procesamiento. En una API alojada como OpenAI o Anthropic, pagas por token. Con un modelo propio, pagas en hardware, electricidad y mantenimiento. No hay forma de evitarlo: la inferencia tiene un coste marginal superior a cero.

Cuando un servicio ofrece un “bot de IA gratuito”, ocurre una de estas cosas:

  1. Pagas directamente la inferencia, por ejemplo aportando tu clave de API.
  2. El servicio absorbe el coste y lo recupera con planes de pago, anuncios o recopilación de datos.
  3. Ejecutas la inferencia tú mismo en tu hardware con un modelo de código abierto.
  4. El plan gratuito tiene un límite bajo, que acota el gasto computacional del proveedor.

Saber cuál se aplica a cada bot es la clave para evaluar si encaja en tu caso de uso.

Las tres categorías de bots de IA gratuitos para Discord

1. Bots de código abierto con alojamiento propio (gratuitos, aportas el hardware)

Es la única opción en la que ningún tercero controla tus límites de uso de IA. Ejecutas un LLM de código abierto localmente o en un VPS, lo conectas a Discord con un bot que escribes o adaptas y te ocupas de todo.

Stack habitual:

Qué obtienes:

  • Ningún coste por mensaje aparte de la electricidad.
  • Control completo del modelo, el prompt de sistema y los datos.
  • Ningún límite impuesto por un proveedor de IA, solo los de la API de Discord.
  • Procesamiento del modelo en tu hardware, sin enviar mensajes a un proveedor externo de LLM. Los mensajes siguen pasando por Discord.

A qué renuncias:

  • Necesitas hardware. Para un modelo de 7.000 millones de parámetros a velocidad razonable hace falta una GPU con al menos 8 GB de VRAM o un Mac moderno con memoria unificada. La inferencia en CPU funciona, pero es lenta: varios segundos por respuesta en un modelo 7B.
  • Mantienes la infraestructura. Actualizaciones, reinicios, supervisión y espacio en disco para los pesos corren por tu cuenta.
  • La calidad es inferior a la de los modelos más avanzados. Llama 3.1 8B es capaz, pero no es GPT-4o ni Claude Sonnet. Sirve para preguntas sencillas y conversaciones informales; se queda corto en razonamiento con matices o diálogos complejos de varios turnos.
  • No hay base de conocimiento, analítica ni transferencia a personas integradas. Construyes lo que necesites.

Hardware mínimo para modelos habituales:

ModeloParámetrosVRAM necesariaRAM solo con CPUVelocidad con GPU
Gemma 2 2B2.000 millones~2 GB~4 GB~60 tokens/s
Llama 3.1 8B8.000 millones~6 GB~10 GB~40 tokens/s
Mistral 7B7.000 millones~6 GB~10 GB~40 tokens/s
Llama 3.1 70B (Q4)70.000 millones~40 GB~48 GB~15 tokens/s

(Velocidades aproximadas medidas con una RTX 4090. Las variantes cuantizadas consumen menos memoria a cambio de una pequeña pérdida de calidad.)

2. Servicios gestionados freemium (plan gratuito con límites)

En estos productos, otra empresa aloja la IA y la infraestructura del bot. Lo configuras desde un panel web. El plan gratuito ofrece uso limitado; pagas para ampliarlo.

Ejemplos:

ServicioPlan gratuitoLímite de mensajesControl del modeloCompatibilidad con DiscordExige tarjeta
Quickchat AIPlan gratuitoEl uso incluido varía por planGestionado por el proveedor (modelos avanzados)Sí, en todos los planesNo
MEE6Plan gratuitoIA solo en PremiumGestionado por el proveedorSíNo en el plan gratuito
BotpressPlan gratuito2.000 mensajes entrantes/mesConfigurableMediante integraciónNo

El plan gratuito de Quickchat AI permite probar sin tarjeta. La integración con Discord está disponible en todos los planes, así que puedes conectar el bot y probarlo con usuarios reales antes de pagar. Se conecta con un clic: en External Apps, abre Discord, pulsa Add to your Discord server y elige el servidor. Los planes de pago empiezan con Starter por 9 USD/mes, u 8 USD/mes con facturación anual.

La principal ventaja de los servicios gestionados son las funciones adicionales a la inferencia: bases de conocimiento construidas con tu web y documentos, analítica de conversaciones (sentimiento y temas), despliegue multicanal (el mismo agente en web, WhatsApp, Slack y Discord) y transferencia a personas cuando la IA no resuelve. Construirlo desde cero sobre un modelo propio es un proyecto de ingeniería considerable.

MEE6 es ante todo un bot de moderación y participación. El chat con IA requiere la suscripción Premium (11,99 USD/mes a principios de 2026). El plan gratuito incluye niveles, comandos básicos de moderación y mensajes de bienvenida, pero no conversaciones con IA.

Botpress ofrece 2.000 mensajes entrantes gratuitos al mes entre todos los canales. Tiene un constructor visual de flujos y admite configuraciones propias de LLM. Sin embargo, configurarlo resulta más complejo que Quickchat para un bot sencillo de Discord, porque está orientado a flujos estructurados y no al chat abierto.

3. Bots con tu propia clave de API (pagas al proveedor del LLM)

La tercera categoría son bots de código abierto que se ejecutan en un servidor, pero llaman a una API comercial (OpenAI, Anthropic, Google, etc.) para la inferencia. Aportas tu clave. El código es gratuito, pero pagas por token al proveedor.

Ejemplos en GitHub:

  • GPT Discord Bot, ejemplo oficial de OpenAI.
  • Varios bots comunitarios con discord.py y el SDK de Python de OpenAI.

Coste por mensaje con API comerciales (aproximado, a principios de 2026):

ModeloEntrada por millón de tokensSalida por millón de tokensCoste aproximado por mensaje*
GPT-4o mini0,15 USD0,60 USD~0,0003 USD
GPT-4o2,50 USD10,00 USD~0,005 USD
Claude 3.5 Haiku0,80 USD4,00 USD~0,002 USD
Claude Sonnet 43,00 USD15,00 USD~0,007 USD
Gemini 2.0 Flash0,10 USD0,40 USD~0,0002 USD

*Suponiendo unos 500 tokens de entrada y 200 de salida por intercambio, sin historial. Si lo incluyes, el coste de entrada crece linealmente con la longitud del contexto.

Con 1.000 mensajes mensuales usando GPT-4o mini, gastarías unos 0,30 USD; con 10.000, unos 3 USD. Parecen cifras pequeñas hasta añadir el historial: si cada mensaje incluye todo el contexto, por ejemplo 10 turnos previos, los tokens de entrada pasan de unos 500 a 5.000. El coste de entrada se multiplica por diez y también aumenta el coste total.

Comparación de costes entre enfoques

La tabla estima costes mensuales según el volumen. “Alojamiento propio” supone un VPS pequeño o hardware existente. “Tu clave de API” usa las tarifas de GPT-4o mini. “Gestionado” toma Quickchat AI como referencia.

Mensajes mensualesAlojamiento propio (Ollama + VPS)Tu clave de API (GPT-4o mini)Gestionado (Quickchat AI)
100~5 a 20 USD (VPS)~0,03 USDGratuito o Starter por 9 USD/mes
1.000~5 a 20 USD (VPS)~0,30 a 3 USDStarter por 9 USD/mes o Basic por 29 USD/mes
5.000~15 a 40 USD (VPS)~1,50 a 15 USDEssential por 99 USD/mes o Professional por 299 USD/mes
10.000~30 a 80 USD (VPS)~3 a 30 USDProfessional por 299 USD/mes o Business por 999 USD/mes
35.000~60 a 150 USD (VPS)~10,50 a 105 USDBusiness por 999 USD/mes o Enterprise desde 0,50 USD/resolución

La horquilla de alojamiento propio depende de usar un VPS solo con CPU, más barato pero lento, o una instancia GPU. Hetzner ofrece VPS con CPU por unos 5 a 10 USD/mes capaces de ejecutar un modelo 7B cuantizado, aunque las respuestas tardan de 5 a 15 segundos. Las instancias GPU en la nube, como Lambda, RunPod o Vast.ai, empiezan en unos 0,20 a 0,50 USD/h por GPU: entre 150 y 360 USD/mes funcionando continuamente. Para uso intermitente, las instancias spot y los proveedores de GPU serverless pueden reducirlo.

La columna de clave propia muestra una horquilla porque el coste depende mucho de incluir historial en cada solicitud. El mínimo es un solo turno sin historial; el máximo, varios turnos con unos 10 mensajes de contexto.

La columna gestionada refleja los precios de Quickchat en junio de 2026. Incluyen gestión de bases de conocimiento, analítica y soporte multicanal, ausentes en las otras opciones sin ingeniería adicional.

Configuración rápida con alojamiento propio: Python + discord.py + Ollama

A continuación tienes un ejemplo mínimo funcional de bot de Discord que usa Ollama para inferencia local. Debes tener Ollama instalado y ejecutándose y un modelo descargado, por ejemplo con ollama pull llama3.1:8b.

Requisitos previos

  1. Python 3.10 o superior.
  2. Ollama instalado y ejecutándose (curl -fsSL https://ollama.com/install.sh | sh).
  3. Un modelo descargado: ollama pull llama3.1:8b.
  4. Un token de bot, creado en el Discord Developer Portal.
  5. El bot añadido al servidor con permisos Send Messages y Read Message History.

Instala las dependencias

pip install discord.py aiohttp

Código del bot

import discord
import aiohttp
import json

DISCORD_TOKEN = "your-bot-token-here"
OLLAMA_URL = "http://localhost:11434/api/chat"
MODEL = "llama3.1:8b"
SYSTEM_PROMPT = "You are a helpful assistant in a Discord server. Keep responses concise."

# Store conversation history per channel (in-memory, resets on restart)
conversations: dict[int, list[dict]] = {}
MAX_HISTORY = 10  # Keep last 10 messages per channel

intents = discord.Intents.default()
intents.message_content = True
client = discord.Client(intents=intents)


async def query_ollama(channel_id: int, user_message: str) -> str:
    """Send a message to Ollama and return the response."""
    if channel_id not in conversations:
        conversations[channel_id] = []

    conversations[channel_id].append({"role": "user", "content": user_message})

    # Trim history to avoid unbounded memory growth
    if len(conversations[channel_id]) > MAX_HISTORY:
        conversations[channel_id] = conversations[channel_id][-MAX_HISTORY:]

    messages = [{"role": "system", "content": SYSTEM_PROMPT}] + conversations[channel_id]

    payload = {
        "model": MODEL,
        "messages": messages,
        "stream": False,
    }

    async with aiohttp.ClientSession() as session:
        async with session.post(OLLAMA_URL, json=payload) as resp:
            if resp.status != 200:
                return f"Ollama returned status {resp.status}"
            data = await resp.json()
            reply = data["message"]["content"]

    conversations[channel_id].append({"role": "assistant", "content": reply})
    return reply


@client.event
async def on_ready():
    print(f"Logged in as {client.user}")


@client.event
async def on_message(message: discord.Message):
    # Ignore own messages
    if message.author == client.user:
        return

    # Only respond when mentioned
    if client.user not in message.mentions:
        return

    # Strip the mention from the message
    content = message.content.replace(f"<@{client.user.id}>", "").strip()
    if not content:
        return

    async with message.channel.typing():
        reply = await query_ollama(message.channel.id, content)

    # Discord has a 2000-character limit per message
    if len(reply) > 2000:
        for i in range(0, len(reply), 2000):
            await message.reply(reply[i:i+2000])
    else:
        await message.reply(reply)


client.run(DISCORD_TOKEN)

Son unas 60 líneas que producen un bot funcional que responde cuando lo mencionas. Mantiene el historial por canal en memoria, que se pierde al reiniciar, y gestiona el límite de 2.000 caracteres por mensaje de Discord.

Qué le falta a este bot mínimo

El código sirve para pruebas y servidores pequeños. Para ir más allá, hay problemas que cualquier bot de producción debe resolver:

  • Historial persistente. El diccionario en memoria se pierde al reiniciar. En producción guardarías las conversaciones en Redis o una base de datos.
  • Límites de solicitudes. Discord admite 5 mensajes cada 5 segundos por canal. Si el bot es popular, necesitas colas.
  • Solicitudes simultáneas. Ollama procesa una solicitud cada vez de forma predeterminada. Varios usuarios simultáneos forman una cola. Puedes usar varias instancias con un balanceador o la opción OLLAMA_NUM_PARALLEL, disponible desde la versión 0.1.33.
  • Errores y reintentos. Ollama puede fallar, agotar la memoria o devolver respuestas malformadas. El bot debe gestionar todos esos casos.
  • Gestión del contexto. MAX_HISTORY = 10 es demasiado simple. Conviene contar tokens y recortar para ajustarse a la ventana del modelo (8.192 tokens por defecto en Llama 3.1 8B, configurable hasta 128.000, con pérdida de calidad en contextos largos).
  • Soporte de hilos. Las conversaciones con bots suelen ocurrir en hilos. Crear hilos y mantener su historial exige lógica adicional.
  • Base de conocimiento / RAG. Para responder desde la documentación del proyecto necesitas generación aumentada por recuperación: crear embeddings, guardarlos en una base vectorial y recuperar fragmentos relevantes antes de enviarlos al LLM.

Dificultades técnicas

Límites de la API de Discord

Discord impone límites en varios niveles:

  • Por ruta: cada endpoint tiene su límite, devuelto en las cabeceras X-RateLimit-Limit, X-RateLimit-Remaining y X-RateLimit-Reset.
  • Global: 50 solicitudes por segundo entre todos los endpoints.
  • Mensajes por canal: 5 cada 5 segundos.
  • Gateway: 120 eventos cada 60 segundos.

La biblioteca discord.py gestiona la mayoría automáticamente encolando solicitudes al llegar al límite. Aun así, un bot presente en muchos servidores o canales puede alcanzar el límite global. Entonces debes estudiar sharding: repartir las conexiones a servidores entre varias conexiones al gateway.

Para los bots con el intent MESSAGE_CONTENT, necesario para leer texto, Discord exige verificación si están en más de 100 servidores. Debes enviar una descripción de su función y conseguir la aprobación de Discord.

Compromisos de calidad del modelo

La distancia entre los modelos pequeños abiertos y los comerciales más avanzados es menor que hace dos años, pero existe. Comparación aproximada en tareas habituales:

TareaModelo local de 7 a 8 mil millonesGPT-4o miniGPT-4o / Claude Sonnet
Conversación informalBuenoBuenoBueno
Preguntas factualesModerado, con más alucinacionesBuenoMuy bueno
Generación de códigoBásicoBuenoMuy bueno
Varios idiomasLimitadoBuenoMuy bueno
Seguimiento de instruccionesModeradoBuenoMuy bueno
Mantener el personajeModeradoBuenoBueno

Para una comunidad de videojuegos con chat informal y consultas sencillas, un modelo local 8B funciona bien. En atención al cliente, donde importa la precisión, la diferencia de calidad supone un problema real. Mantener el personaje también depende mucho de la configuración: cómo crear un chatbot de IA para roleplay que se mantenga en su personaje muestra cuánto aportan un prompt de personalidad y una base de conocimiento canónica incluso a un modelo estándar.

Gestión de la ventana de contexto

Es el reto técnico más infravalorado en los bots de Discord. Las conversaciones tienen varios turnos: los usuarios mandan muchos mensajes cortos y el bot debe recordar lo anterior.

Cada vez que responde, debe incluir el historial en el prompt. Eso significa:

  • Los tokens de entrada crecen linealmente con la conversación.
  • En bots con API, el coste crece también linealmente.
  • En modelos locales, la inferencia tarda más al crecer el contexto (cuadráticamente en el cálculo de atención, aunque optimizaciones como Flash Attention ayudan).
  • En algún momento se supera la ventana del modelo y necesitas una estrategia: recortar el inicio, resumir lo antiguo o empezar una conversación nueva.

Una opción práctica es conservar una ventana móvil de los últimos N mensajes y anteponer un resumen breve del contexto anterior en conversaciones largas. Requiere una llamada adicional al LLM para el resumen, pero acota el coste por mensaje.

Implicaciones de privacidad

Cambian mucho según el enfoque:

  • Alojamiento propio: el procesamiento del LLM permanece en tu hardware. Controlas la conservación y el acceso en esa parte, aunque Discord sigue transportando los mensajes. Es la opción con más control sobre el procesamiento de IA.
  • Tu clave de API: los mensajes se envían al proveedor (OpenAI, Anthropic, etc.). Revisa sus políticas de conservación. A principios de 2026, OpenAI afirma que no entrena con datos de API por defecto y Anthropic tiene una política similar. Sin embargo, los mensajes pasan por sus servidores.
  • Servicios gestionados: el proveedor procesa los mensajes. Revisa su política de privacidad y sus acuerdos de tratamiento de datos. Para empresas que tratan datos de usuarios de la UE, importa el RGPD. Quickchat AI, por ejemplo, procesa datos en la UE y ofrece un DPA a clientes empresariales.

En un servidor informal, la privacidad no suele ser la preocupación principal. Para una empresa que atiende clientes mediante un bot de Discord, conviene saber exactamente dónde se guardan los datos y quién accede a ellos.

Alojamiento propio frente a gestionado: coste total

El procesamiento solo cuenta parte de la historia. El coste total incluye el tiempo de ingeniería.

Lo que construyes con un bot propio:

  • Código y despliegue del bot.
  • Almacenamiento del historial.
  • Gestión de la ventana de contexto.
  • Tratamiento de errores y supervisión.
  • Pipeline de base de conocimiento / RAG, si hace falta.
  • Analítica y registros.
  • Soporte multicanal, si hace falta.

Como estimación conservadora, un bot de IA para Discord listo para producción con historial, base de conocimiento y analítica básica requiere de 40 a 80 horas de un desarrollador experimentado. Mantener modelos, dependencias, depuración y supervisión exige tiempo continuo.

Lo que ofrece un servicio gestionado de serie:

  • Alojamiento y gestión de disponibilidad.
  • Base de conocimiento creada desde tu web, documentación y archivos.
  • Analítica de conversaciones: sentimiento, temas y valoraciones.
  • Despliegue multicanal: el mismo agente en Discord, web, WhatsApp, Slack, etc.
  • Transferencia a personas cuando la IA no puede ayudar.
  • AI Actions, llamadas de API personalizadas activadas por el contexto, incluidas acciones de moderación como aislamiento temporal, expulsión y baneo.

La pregunta es si la cuota mensual resulta menor que el coste de oportunidad de tu tiempo. Para un desarrollador que lleva un servidor por afición, alojarlo con Ollama probablemente encaja. Para una empresa que usa Discord como soporte al cliente, suele compensar el servicio gestionado: la analítica, el conocimiento y la transferencia alrededor del LLM hacen útil al bot. La guía del bot de tickets con IA construye esa combinación completa en el plan gratuito, para comparar frente a algo concreto.

Resumen

No existe un bot de IA gratuito universalmente “mejor” para Discord. Depende de qué signifique “gratuito” para ti:

  • Si quieres evitar cuotas de IA y ya tienes hardware, usa Ollama y un modelo abierto con alojamiento propio. Controlas el modelo y su procesamiento local, aunque los mensajes pasan por Discord. Renuncias a parte de la calidad de los modelos avanzados y asumes toda la ingeniería.
  • Si quieres probar con usuarios reales antes de pagar, el plan gratuito de Quickchat AI permite empezar sin tarjeta. La integración con Discord funciona en él y los planes de pago empiezan en 9 USD/mes.
  • Si quieres calidad avanzada y sabes gestionar claves, un bot con tu API ofrece costes bajos por mensaje, especialmente con GPT-4o mini o Gemini Flash. Aun así, debes alojar el código y construir las funciones adicionales al chat.
  • Si necesitas funciones de producción (base de conocimiento, analítica, transferencia y multicanal), el servicio gestionado es la vía más rápida. Evalúa el volumen esperado y las funciones que necesitas.

La palabra “gratuito” en “bot de IA gratuito para Discord” abarca mucho. El procesamiento siempre cuesta algo. La cuestión es quién paga y qué obtienes o sacrificas a cambio.

Para comparar todas las opciones, no solo las gratuitas, consulta Mejores bots de IA para Discord en 2026. Si tu servidor es un canal de soporte, Bot de tickets con IA para Discord explica cómo responder desde la documentación y derivar el resto a hilos privados.