Бесплатные AI-боты для Discord в 2026 году

Jakub Swistak
Опубликовано Обновлено Время чтения: 8 мин
Бесплатные AI-боты Discord: тарифы, лимиты сообщений, выбор модели и собственный хостинг

Поиск бесплатного AI-бота для Discord даёт десятки вариантов. Некоторые действительно бесплатны. Большинство не бесплатны в том смысле, которого вы ожидаете. Разберём доступные решения, компромиссы и реальную стоимость, когда ответы создаёт AI.

Почему бесплатная AI устроена непросто

Работа LLM стоит денег. При каждом сообщении и ответе кто-то оплачивает вычисления. В API OpenAI или Anthropic оплата идёт за токены. При собственном размещении вы платите за оборудование, электричество и обслуживание. Дополнительная генерация не бывает полностью беззатратной.

Предложение бесплатного AI-бота означает одно из следующего:

  1. Вы сами оплачиваете генерацию, например своим API-ключом.
  2. Сервис берёт расходы на себя, окупая их платными тарифами, рекламой или сбором данных.
  3. Вы запускаете открытую модель на собственном оборудовании.
  4. Бесплатный тариф ограничен малым объёмом, сдерживающим расходы поставщика.

Понять, какой вариант используется, необходимо для оценки пригодности бота.

Три категории бесплатных AI-ботов Discord

1. Открытые боты на собственном хостинге: вы предоставляете оборудование

Только здесь сторонний поставщик не определяет лимиты использования модели. Вы запускаете открытую LLM локально или на VPS, подключаете собственным или скопированным ботом и обслуживаете всё самостоятельно.

Типичный набор:

  • Ollama для локальных моделей.
  • discord.py или discord.js для Discord.
  • Модель вроде Llama 3.1 8B, Mistral 7B или Gemma 2 9B.

Что вы получаете:

  • Нет платы за сообщение кроме электричества.
  • Полный контроль над моделью, промптом и данными.
  • Нет лимитов поставщика модели, но ограничения Discord API сохраняются.
  • Локальная генерация: сообщения не отправляются внешнему поставщику модели.

Что вы берёте на себя:

  • Оборудование. Для модели 7B с приемлемой скоростью нужна GPU с минимум 8 ГБ VRAM или современный Mac с объединённой памятью. CPU тоже работает, но ответ занимает несколько секунд и более.
  • Обслуживание: обновления, перезапуски, мониторинг и место для весов моделей.
  • Более низкое качество по сравнению с передовыми моделями. Llama 3.1 8B справляется с простыми вопросами и обычной беседой, но уступает GPT-4o и Claude Sonnet в сложных рассуждениях и многошаговом диалоге.
  • Отсутствие готовой базы знаний, аналитики и передачи человеку. Нужные функции придётся создать.

Минимальные требования распространённых моделей:

МодельПараметрыVRAMRAM при CPUСкорость на GPU
Gemma 2 2B2B~2 ГБ~4 ГБ~60 токенов/с
Llama 3.1 8B8B~6 ГБ~10 ГБ~40 токенов/с
Mistral 7B7B~6 ГБ~10 ГБ~40 токенов/с
Llama 3.1 70B (Q4)70B~40 ГБ~48 ГБ~15 токенов/с

Скорости приблизительные, измерены на RTX 4090. Квантованные варианты требуют меньше памяти ценой небольшого снижения качества.

2. Управляемые freemium-сервисы: бесплатный тариф с ограничениями

Поставщик размещает AI и инфраструктуру, а вы настраиваете бота в веб-панели. Бесплатный тариф даёт ограниченное использование, за больший объём нужно платить.

Примеры:

СервисБесплатный тарифЛимит сообщенийКонтроль моделиDiscordНужна карта
Quickchat AIБесплатныйОбъём зависит от тарифаПередовые модели под управлением поставщикаДа, все тарифыНет
MEE6БесплатныйAI только в premiumУ поставщикаДаДля бесплатного нет
BotpressБесплатный2 000 входящих сообщений/мес.НастраиваетсяЧерез интеграциюНет

Бесплатный Quickchat AI позволяет тестировать без карты. Discord доступен во всех тарифах, поэтому бота можно проверить с реальными пользователями до покупки. Подключение простое: откройте External Apps, выберите Discord, нажмите Add to your Discord server и укажите сервер. Платные тарифы начинаются со Starter за 9 $ в месяц или 8 $ при годовой оплате.

Преимущество управляемого сервиса в дополнительных функциях: база знаний из документов и сайта, аналитика настроения и тем, один агент для сайта, WhatsApp, Slack и Discord, а также передача человеку. Самостоятельная реализация всего этого поверх локальной модели является большим инженерным проектом.

MEE6 прежде всего предназначен для модерации и вовлечения. AI-чат доступен в premium за 11,99 $ в месяц по состоянию на начало 2026 года. Бесплатно предоставляются уровни, базовые команды и приветствия, но не AI-разговоры.

Botpress даёт 2 000 входящих сообщений в месяц суммарно по каналам, визуальный редактор и собственные настройки LLM. Для простого Discord-бота настройка сложнее Quickchat, поскольку продукт ориентирован на структурированные сценарии, а не свободный чат.

3. Боты со своим API-ключом: оплата поставщику LLM

Третья категория: открытый бот на сервере, который использует коммерческий API OpenAI, Anthropic, Google или другого поставщика. Вы указываете ключ. Код бесплатен, генерация оплачивается за токены.

Примеры на GitHub:

  • GPT Discord Bot, официальный пример OpenAI.
  • Общественные проекты на discord.py и OpenAI Python SDK.

Примерная стоимость API на начало 2026 года:

МодельВход за 1 млн токеновВыход за 1 млн токеновЦена сообщения*
GPT-4o mini0,15 $0,60 $~0,0003 $
GPT-4o2,50 $10,00 $~0,005 $
Claude 3.5 Haiku0,80 $4,00 $~0,002 $
Claude Sonnet 43,00 $15,00 $~0,007 $
Gemini 2.0 Flash0,10 $0,40 $~0,0002 $

*Примерно 500 входных и 200 выходных токенов без истории. При её добавлении входные расходы линейно растут с длиной контекста.

Тысяча сообщений в месяц на GPT-4o mini обойдётся примерно в 0,30 $, 10 тысяч в 3 $. При учёте истории эти цифры растут: десять прошлых реплик могут увеличить вход с 500 до 5 000 токенов. Входная часть цены вырастет в десять раз, увеличивая общую стоимость, но не обязательно в десять раз целиком.

Сравнение расходов

Таблица оценивает месячные затраты при разных объёмах. Свой хостинг предполагает небольшой VPS или имеющееся оборудование. API-ключ рассчитан по GPT-4o mini, управляемый вариант по Quickchat AI.

Сообщений/мес.Свой Ollama и VPSСвой ключ GPT-4o miniQuickchat AI
100~5-20 $ за VPS~0,03 $Бесплатно или Starter 9 $/мес.
1 000~5-20 $ за VPS~0,30-3,00 $Starter 9 $ или Basic 29 $/мес.
5 000~15-40 $ за VPS~1,50-15,00 $Essential 99 $ или Professional 299 $/мес.
10 000~30-80 $ за VPS~3,00-30,00 $Professional 299 $ или Business 999 $/мес.
35 000~60-150 $ за VPS~10,50-105,00 $Business 999 $/мес. или Enterprise от 0,50 $ за решение

Разброс собственного хостинга зависит от CPU или GPU. CPU VPS Hetzner за 5-10 $ в месяц запускают квантованную 7B-модель с ответами за 5-15 секунд. GPU у Lambda, RunPod или Vast.ai начинаются примерно с 0,20-0,50 $ в час, то есть 150-360 $ в месяц при непрерывной работе. Для периодической нагрузки spot-инстансы и serverless GPU могут снизить стоимость.

Разброс API связан с историей: нижняя граница для отдельной реплики без контекста, верхняя для примерно десяти сообщений истории.

Управляемая колонка отражает цены Quickchat на июнь 2026 года. В неё входят знания, аналитика и несколько каналов, которые в других вариантах требуют дополнительной разработки.

Быстрый собственный запуск: Python, discord.py и Ollama

Минимальный пример ниже использует локальную генерацию. Ollama должна быть установлена и запущена, модель загружена, например командой ollama pull llama3.1:8b.

Требования

  1. Python 3.10+.
  2. Установленная и работающая Ollama: curl -fsSL https://ollama.com/install.sh | sh.
  3. Загруженная модель: ollama pull llama3.1:8b.
  4. Токен из Discord Developer Portal.
  5. Бот на сервере с Send Messages и Read Message History.

Установка зависимостей

pip install discord.py aiohttp

Код бота

import discord
import aiohttp
import json

DISCORD_TOKEN = "your-bot-token-here"
OLLAMA_URL = "http://localhost:11434/api/chat"
MODEL = "llama3.1:8b"
SYSTEM_PROMPT = "You are a helpful assistant in a Discord server. Keep responses concise."

# Store conversation history per channel (in-memory, resets on restart)
conversations: dict[int, list[dict]] = {}
MAX_HISTORY = 10  # Keep last 10 messages per channel

intents = discord.Intents.default()
intents.message_content = True
client = discord.Client(intents=intents)


async def query_ollama(channel_id: int, user_message: str) -> str:
    """Send a message to Ollama and return the response."""
    if channel_id not in conversations:
        conversations[channel_id] = []

    conversations[channel_id].append({"role": "user", "content": user_message})

    # Trim history to avoid unbounded memory growth
    if len(conversations[channel_id]) > MAX_HISTORY:
        conversations[channel_id] = conversations[channel_id][-MAX_HISTORY:]

    messages = [{"role": "system", "content": SYSTEM_PROMPT}] + conversations[channel_id]

    payload = {
        "model": MODEL,
        "messages": messages,
        "stream": False,
    }

    async with aiohttp.ClientSession() as session:
        async with session.post(OLLAMA_URL, json=payload) as resp:
            if resp.status != 200:
                return f"Ollama returned status {resp.status}"
            data = await resp.json()
            reply = data["message"]["content"]

    conversations[channel_id].append({"role": "assistant", "content": reply})
    return reply


@client.event
async def on_ready():
    print(f"Logged in as {client.user}")


@client.event
async def on_message(message: discord.Message):
    # Ignore own messages
    if message.author == client.user:
        return

    # Only respond when mentioned
    if client.user not in message.mentions:
        return

    # Strip the mention from the message
    content = message.content.replace(f"<@{client.user.id}>", "").strip()
    if not content:
        return

    async with message.channel.typing():
        reply = await query_ollama(message.channel.id, content)

    # Discord has a 2000-character limit per message
    if len(reply) > 2000:
        for i in range(0, len(reply), 2000):
            await message.reply(reply[i:i+2000])
    else:
        await message.reply(reply)


client.run(DISCORD_TOKEN)

Пример примерно из 60 строк создаёт работающего бота, отвечающего на упоминания. Он хранит историю отдельно для каналов в памяти, теряет её при перезапуске и учитывает ограничение Discord в 2 000 символов.

Чего не хватает минимальному боту

Для тестов и малых серверов пример подходит. В полноценной эксплуатации потребуются следующие функции:

  • Постоянная история: Словарь исчезает при перезапуске. Для рабочего сервиса нужны Redis или база данных.
  • Ограничения частоты: Discord допускает 5 сообщений за 5 секунд на канал, поэтому популярному боту нужна очередь.
  • Параллельные запросы: Ollama по умолчанию обрабатывает один запрос. Можно поставить несколько экземпляров за балансировщиком или использовать OLLAMA_NUM_PARALLEL, доступную с v0.1.33.
  • Ошибки и повторные попытки: Ollama может остановиться, исчерпать память или вернуть некорректный ответ. Бот должен обрабатывать эти ситуации.
  • Контекстное окно: MAX_HISTORY = 10 слишком прост. Лучше считать токены и укладывать историю в окно. Для Llama 3.1 8B здесь предполагаются стандартные 8 192 токена с настройкой до 128K и снижением качества длинных контекстов.
  • Ветки: Создание веток и отдельная история требуют дополнительной логики.
  • База знаний / RAG: Для ответов по документации нужны embeddings, векторная база и извлечение нужных фрагментов перед запросом к LLM.

Технические сложности

Лимиты Discord API

Ограничения применяются на нескольких уровнях:

  • Маршрут: Каждый endpoint имеет лимит в заголовках X-RateLimit-Limit, X-RateLimit-Remaining, X-RateLimit-Reset.
  • Глобальный: 50 запросов в секунду.
  • Канал: 5 сообщений за 5 секунд.
  • Gateway: 120 событий за 60 секунд.

discord.py автоматически учитывает большинство ограничений, ставя запросы в очередь. При большом числе каналов или серверов глобальный лимит всё же достижим. Тогда стоит рассмотреть sharding, то есть распределение серверов по нескольким Gateway-подключениям.

Боту с MESSAGE_CONTENT, необходимым для чтения текста, нужна верификация после подключения более чем к 100 серверам. Она включает описание назначения и одобрение Discord.

Компромиссы качества

Разрыв между небольшими открытыми и передовыми коммерческими моделями сократился за два года, но остаётся. Приблизительное сравнение:

ЗадачаЛокальная модель 7-8BGPT-4o miniGPT-4o / Claude Sonnet
Обычный разговорХорошоХорошоХорошо
Фактические вопросыСредне, больше выдумокХорошоОчень хорошо
Генерация кодаБазовоХорошоОчень хорошо
Несколько языковОграниченноХорошоОчень хорошо
Следование инструкциямСреднеХорошоОчень хорошо
Сохранение ролиСреднеХорошоХорошо

Для игровой группы с обычной беседой и простыми запросами модель 8B подходит. Для точной поддержки разрыв качества становится проблемой. Сохранение характера зависит и от настройки: руководство по ролевому чатботу показывает, насколько помогают промпт личности и база канона даже стандартной модели.

Управление контекстом

Эту задачу часто недооценивают. В Discord люди отправляют много коротких сообщений, и бот должен помнить ранние реплики.

При каждом ответе история снова включается в промпт. Это означает:

  • Линейный рост входных токенов с длиной разговора.
  • Такой же рост соответствующих API-расходов.
  • Рост времени локальной генерации с контекстом. Вычисления attention квадратичны, хотя Flash Attention и другие оптимизации помогают.
  • Необходимость обрезать начало, суммировать старые сообщения или начать заново при превышении окна.

Практичный вариант: скользящее окно последних N сообщений и короткая сводка более ранних. Сводка требует ещё одного LLM-вызова, но ограничивает стоимость каждой последующей реплики.

Приватность

Обработка зависит от подхода:

  • Свой хостинг: Модель обрабатывает сообщения на вашем оборудовании. Вы контролируете хранение и доступ к этой обработке.
  • Свой API-ключ: Сообщения отправляются OpenAI, Anthropic или другому поставщику. Изучите сроки хранения. На начало 2026 года OpenAI заявляет, что по умолчанию не обучается на API-данных; Anthropic придерживается похожей политики. Данные всё равно проходят через их серверы.
  • Управляемый сервис: Данные обрабатывает поставщик. Проверьте политику и договор обработки. Для компаний с данными пользователей ЕС важен GDPR. Например, Quickchat AI обрабатывает данные в ЕС и предоставляет бизнес-клиентам DPA.

Для неформального сервера приватность часто не главный критерий. Компании, использующей Discord для поддержки, необходимо понимать места хранения и круг доступа к разговорам.

Свой хостинг или сервис: полная стоимость владения

Вычисления составляют только часть цены. Полная стоимость включает инженерное время.

Что нужно создать самостоятельно:

  • Код и размещение бота.
  • Хранилище разговоров.
  • Управление контекстом.
  • Обработку ошибок и мониторинг.
  • Базу знаний и RAG при необходимости.
  • Аналитику и журналирование.
  • Дополнительные каналы при необходимости.

Рабочий AI-бот с историей, знаниями и базовой аналитикой консервативно требует 40-80 часов опытного разработчика. Обновления моделей и зависимостей, отладка и мониторинг затем продолжаются.

Что даёт управляемая услуга:

  • Хостинг и обеспечение доступности.
  • Базу знаний из сайта, документации и файлов.
  • Аналитику настроения, тем и оценок.
  • Одного агента для Discord, сайта, WhatsApp, Slack и других каналов.
  • Передачу человеку, если AI не помогает.
  • AI Actions, запускающие API по контексту, включая timeout, kick и ban.

Сравните месячную цену с ценностью инженерного времени. Для хобби собственная Ollama может быть верным решением. Для компании расчёт обычно склоняется к сервису, поскольку именно знания, аналитика и передача делают бота полезным. Руководство по AI-боту заявок собирает такую систему на бесплатном тарифе и даёт конкретную основу сравнения.

Итоги

Универсального лучшего бесплатного бота нет. Решение зависит от смысла бесплатности:

  • Если есть оборудование и вы хотите избежать регулярной платы за сервис, запускайте Ollama и открытую модель. Вы получите контроль и локальную генерацию, но уступите в качестве передовым моделям и возьмёте разработку на себя.
  • Для теста с реальными пользователями без оплаты доступен Quickchat AI без карты. Discord есть в бесплатном тарифе, платные начинаются от 9 $ в месяц.
  • Для качества передовых моделей при самостоятельном управлении ключами подойдёт API-бот с небольшими расходами за сообщение, особенно GPT-4o mini или Gemini Flash. Хостинг и дополнительные функции останутся вашей задачей.
  • Для знаний, аналитики, передачи человеку и нескольких каналов быстрее управляемый сервис. Оценивайте его по ожидаемому объёму и нужным функциям.

Слово бесплатно скрывает важный вопрос: вычисления всегда имеют цену. Кто её оплачивает и что вы получаете или теряете взамен?

Более широкий обзор: лучшие AI-боты Discord в 2026 году. Для поддержки AI-бот заявок показывает ответы по документации и эскалацию в приватные ветки.