Воркер-ноды

Воркер-ноды

Воркер-ноды — серверы, на которых запускаются локальные языковые модели. RouterAI маршрутизирует запросы между доступными нодами.

Основные возможности

  • Просмотр статуса всех подключённых нод
  • Управление загруженными моделями
  • Загрузка новых моделей (из HuggingFace или локального файла)
  • Удаление моделей с воркера
  • Мониторинг логов и состояния нод
  • Просмотр информации об оборудовании (GPU, RAM, CPU)
  • Настройка приоритета и веса для балансировки нагрузки
  • Настройка поддерживаемых API форматов (Responses API, Messages API)

Список нод

Колонка Описание
Название Имя воркер-ноды (node_id)
Адрес URL ноды
Статус Текущий статус ноды
Текущая модель Загруженная и запущенная модель

Статусы ноды

Статус Описание
idle Нода подключена, модель не загружена
busy Запуск модели в процессе
ready Модель загружена и готова к работе
error Ошибка при загрузке модели
offline Нода не отвечает

Управление моделями

Загрузка модели из HuggingFace

  1. Откройте страницу воркер-ноды
  2. Нажмите Загрузить модель
  3. Выберите вкладку HuggingFace
  4. Найдите модель через поиск
  5. Выберите квантизацию (GGUF)
  6. Нажмите Загрузить

Загрузка модели из файла

  1. Откройте страницу воркер-ноды
  2. Нажмите Загрузить модель
  3. Выберите вкладку Файл
  4. Загрузите один или несколько GGUF-файлов (поддерживается загрузка по частям)
  5. Нажмите Загрузить

Управление загрузкой

Во время загрузки модели доступны следующие действия:
- Пауза — приостановить загрузку
- Возобновить — продолжить приостановленную загрузку
- Отмена — отменить загрузку и очистить файлы

Запуск модели

После загрузки модели её необходимо запустить:

  1. В списке моделей найдите нужную
  2. Нажмите Запустить
  3. Выберите GPU для запуска (отображается VRAM каждой карты и предупреждение при нехватке памяти)
  4. При необходимости настройте дополнительные параметры:
Параметр Описание
Max Sequences Максимальное количество последовательностей, обрабатываемых одновременно (по умолчанию: 256)
GPU Memory Utilization Доля VRAM под KV-кэш, от 0.0 до 1.0 (по умолчанию: 0.9)
Отключить Thinking Отключить режим размышлений для поддерживаемых моделей (disable_thinking)
Tool Call Parser Парсер вызовов инструментов (напр. hermes, mistral, qwen2_5). Если не указан — определяется автоматически
Reasoning Parser Парсер цепочки размышлений (напр. deepseek_r1, qwen3, granite). Если не указан — определяется автоматически
  1. Дождитесь статуса ready

Удаление модели

  1. В списке моделей найдите нужную
  2. Нажмите Удалить
  3. Подтвердите действие

Редактирование ноды

На странице редактирования доступны следующие настройки:

Настройки маршрутизации

Поле Тип Описание
Приоритет Число (0–100) Чем выше значение — тем приоритетнее нода. Ноды с наивысшим приоритетом получают трафик первыми
Вес Число (1–100) Вес для weighted random балансировки. Больше вес — больше трафика

Поддерживаемые API форматы

Укажите, какие API форматы поддерживает нода нативно. Если формат не поддерживается — запросы будут автоматически конвертированы в Chat Completions.

Поле Описание
OpenAI Responses API (POST /v1/responses) Нода поддерживает OpenAI Responses API нативно
Anthropic Messages API (POST /v1/messages) Нода поддерживает Anthropic Messages API нативно

Метаданные

Дополнительные данные в формате JSON (опционально).

Мониторинг

Логи ноды

На странице ноды доступны логи в реальном времени. Используйте их для диагностики проблем. Доступна загрузка лог-файлов за конкретную дату.

Статус здоровья

RouterAI периодически проверяет доступность нод. Нода считается недоступной, если не отвечает в течение заданного таймаута.

Информация об оборудовании

На странице ноды отображается информация о GPU (модель, VRAM, Bus ID), RAM, CPU (модель, количество ядер), версия приложения воркера и наличие доступа в интернет.

Важные замечания

⚠️ Воркер-ноды регистрируются в системе автоматически при первом подключении через Endpoints API.

⚠️ Одновременно на ноде может быть запущена только одна модель (зависит от конфигурации воркера).

⚠️ При перезапуске ноды загруженная модель может быть выгружена.

Связанные разделы