В чем подвох бесплатных моделей на OpenRouter и TokenRouter
Нейросети / ИИ

В чем подвох бесплатных моделей на OpenRouter и TokenRouter

Подвох не в обязательной скрытой оплате за каждый токен. Бесплатный маршрут действительно может иметь цену $0 за вход и выход, но взамен пользователь получает жесткие или нераскрытые лимиты, меняющийся пул вычислений, очереди, неодинаковые условия у providers и отсутствие договорной…

Елена Кравцова
Елена Кравцова
Редактор и автор статей14 мин

Подвох не в обязательной скрытой оплате за каждый токен. Бесплатный маршрут действительно может иметь цену $0 за вход и выход, но взамен пользователь получает жесткие или нераскрытые лимиты, меняющийся пул вычислений, очереди, неодинаковые условия у providers и отсутствие договорной гарантии доступности. Для учебы и прототипа на несекретных данных этого достаточно. Для приватного кода, пакетной обработки и продакшена сначала нужны проверка конкретного маршрута, ограничение расходов и запасной платный либо локальный вариант.

Сравнение актуально на 6 сентября 2026 года. Под TokenRouter здесь понимается сервис tokenrouter.com с API api.tokenrouter.com/v1, принадлежащий Artemis Tokenrouter Inc. Его легко перепутать с одноименными tokenrouter.io, tokenrouter.me и локальным open-source-прокси. У них другие владельцы, тарифы и правила.

Что на самом деле означает «бесплатная модель»

Одинаковая надпись Free может описывать разные экономические схемы. От схемы зависят срок доступа, лимиты и то, кто обрабатывает данные.

Вариант За что не платит пользователь Где появляется расход или ограничение
Модель с нулевой ценой за токены За входные и выходные токены конкретного model ID Квота запросов, низкая concurrency, очередь, меняющийся provider
Временная промоакция За выбранную модель до даты окончания акции После акции включается обычная цена или исчезает endpoint
Подарочные credits За использование в пределах подаренного баланса Credits могут иметь срок, ограничения и не возвращаются деньгами
Бесплатный тариф шлюза За сам роутер или панель Upstream-токены оплачиваются отдельно по собственным ключам
Open-weight-модель локально За облачный inference Нужны оборудование, электричество, настройка и сопровождение

У OpenRouter есть два разных бесплатных механизма. Суффикс :free выбирает бесплатный вариант конкретной модели. openrouter/free сначала отбирает подходящие по функциям модели, а затем случайно назначает одну из доступных. Фактический model ID приходит в ответе, но следующий запрос может попасть к другой модели. Читать полный обзор сервиса OpenRouter.

У TokenRouter на дату проверки подтвержден отдельный z-ai/glm-5.3-free с ценой $0 за миллион входных и выходных токенов. При этом обычный z-ai/glm-5.3 был бесплатен по недельной акции только до 4 сентября. Похожее название не переносит условия промоакции на новый ID и наоборот.

Лимиты: где есть точные числа, а где только предупреждение

OpenRouter фиксирует лимиты бесплатных вариантов на уровне аккаунта. TokenRouter публикует общую зависимость concurrency от баланса, но не раскрывает единую квоту бесплатных моделей.

Условие на 06.09.2026 OpenRouter :free TokenRouter.com free SKU
Цена входа и выхода $0 у конкретного :free ID $0 у проверенного z-ai/glm-5.3-free
Запросов в минуту 20 Универсальное число не опубликовано
Запросов в сутки 50, если за все время куплено менее $10 credits; 1000 после покупки от $10 Не опубликовано
TPM и суточные токены Единого общего free-лимита в изученных правилах нет; возможны ограничения provider Не опубликованы
Одновременные запросы Зависит также от upstream capacity и защиты платформы 5 при текущем балансе выше $0 и до $10; таблица не описывает строго нулевой баланс
Что произойдет при перегрузке 429 от OpenRouter либо provider; возможен автоматический fallback Запрос могут поставить в очередь, замедлить или отклонить
Гарантия мощности Нет договорной гарантии Free Страница free-модели прямо не гарантирует стабильность и concurrency

У TokenRouter concurrency растет вместе с текущим балансом: 10 одновременных запросов при $10–30, 15 при $30–100, 30 при $100–200 и 80 при $200–500. Выше $500 действует «стандартный лимит», но его число не указано. Правила также позволяют менять ограничения с учетом истории использования, модели, provider, funding status и risk signals.

Поэтому пользовательское сообщение «у меня было 8 RPM» нельзя превращать в характеристику тарифа. Это наблюдение конкретного аккаунта в конкретный день. Без опубликованного free-контракта безопасно считать RPM, TPM, суточную квоту, время сброса и работу при нулевом балансе неизвестными.

Почему 50 или 1000 запросов не равны доступной мощности

Суточный счетчик — только первый барьер. Запрос может не пройти из-за перегруженного upstream-провайдера, локального ограничения модели, DDoS-защиты или недостатка свободных GPU. Повторные попытки повышают задержку, а иногда расходуют квоту — единое публичное правило учета неуспешных retries для всех маршрутов не найдено.

В потоковом ответе ошибка способна появиться уже после начала генерации. Клиент получил HTTP 200, но поток завершился событием с ошибкой. Приложение, которое считает любой начавшийся ответ успешным, сохранит оборванный JSON или неполный код.

Маршрутизация меняет не только скорость

Агрегатор отправляет запрос не абстрактной модели, а конкретному endpoint. У одного семейства могут различаться provider, регион, оборудование, точность весов, контекст, максимальный ответ и поддержка параметров.

Что может меняться Практическое последствие Что проверять
Provider Иная задержка, квота и политика хранения Фактический provider в логах, возможность закрепить маршрут
Quantization INT4/FP4 экономит память, но может менять ответы Точность весов и возможность фильтрации
Checkpoint Preview, дообученная или оптимизированная сборка ведет себя иначе Полный model ID и дата версии
Контекст Заявленное окно семейства может не совпасть с endpoint Максимальный input и output конкретного маршрута
Tools и structured output Provider может не поддержать параметр или проигнорировать его Строгий JSON, tool call, finish_reason, схема ошибок
Fallback Запрос обслужит другой provider или совместимая модель Допустимый список и запрет нежелательной подмены
Cache Повтор кажется быстрее и дешевле, чем новый запрос Отключение либо отдельный учет cache в тесте

OpenRouter позволяет задать порядок и список providers, отключить fallback, потребовать поддержку всех параметров, отфильтровать quantization и поставить максимальную цену. Без строгого требования часть неизвестных параметров может быть проигнорирована.

У openrouter/free случайная модель — заявленная функция. Такой маршрут подходит, чтобы быстро получить ответ, но не подходит для регрессионного теста: сегодня код написал один checkpoint, завтра — другая модель.

TokenRouter описывает автоматический fallback на другого provider той же или совместимой модели. Его правила разрешают менять routing pool и приоритеты. В публичных материалах не найдены гарантии, что пользователь Personal может закрепить free-endpoint, запретить переход на совместимую модель и увидеть точную quantization. Пока этих гарантий нет, model name нельзя считать доказательством идентичного inference.

Хороший пример — августовский запуск GLM-5.3: TokenRouter раскрывал собственный Blackwell-пул, DFlash2 drafter и NVFP4 checkpoint. Такая оптимизация может быть быстрой и полезной, но она показывает, почему результат надо привязывать к endpoint, а не только к названию семейства.

Бесплатность не определяет приватность

Утверждения «все бесплатные providers обучаются на промптах» и «zero data retention защищает любой запрос» одинаково неточны. Нужно проследить весь маршрут: клиент → агрегатор → provider → временные буферы, логи и поддержка.

Как обращается с данными OpenRouter

OpenRouter не хранит содержимое prompts и responses по умолчанию. Отдельно включаются приватное логирование входов/выходов и разрешение платформе использовать их для улучшения продукта; обе опции выключены по умолчанию. Метаданные запроса — время, число токенов, latency, model/provider и стоимость — сохраняются.

У upstream-провайдеров свои правила. На странице каждого endpoint указываются retention и возможность обучения; встречаются zero-retention, хранение 30 дней и неизвестный срок. Большинство перечисленных providers помечены no-training, отдельные — may train. Настройки обучения разделены для бесплатных и платных маршрутов.

Для чувствительного запроса можно потребовать data_collection: deny и zdr: true. Тогда роутер исключит endpoints, которые не соответствуют политике. Если подходящего бесплатного endpoint нет, правильный результат — ошибка, а не ослабление требования.

Как обращается с данными TokenRouter

Политики TokenRouter обещают не использовать Customer Content для обучения общих моделей и не хранить prompts/outputs по умолчанию. Содержимое обычно обрабатывается в памяти и удаляется после ответа.

Исключения существенны: opt-in logging, support и debugging, расследование abuse/fraud/security, законный запрос властей, временные buffer/cache/queue, а также функции с файлами, историей, vector store или evaluations. Метаданные включают IP, headers, account ID, model ID, токены, latency и billing records. Единого срока для всех метаданных нет.

Платформа старается выбирать no-training и ZDR-конфигурации, но прямо не гарантирует одинаковую retention/training policy каждого стороннего provider. Публичной endpoint-матрицы для бесплатных TokenRouter-моделей не найдено. Поэтому private code нельзя отправлять только на основании общей надписи ZDR.

Данные могут обрабатываться в США, Сингапуре, Японии, Евросоюзе и других странах, где работают поставщики. Конкретная data residency появляется только в отдельном письменном enterprise-соглашении.

Региональные правила могут быть важнее технической доступности

Conditions of Use TokenRouter запрещают предоставлять или использовать сервис для либо от имени сторон, находящихся или зарегистрированных в России, Беларуси, Иране, КНДР, Кубе и некоторых регионах Украины. Также действуют экспортные ограничения для отдельных видов обучения и конечного использования. Обход регионального запрета через VPN или proxy условиями не разрешен.

Для разработчика или компании из России это самостоятельный стоп-фактор. Открывающийся сайт и работающий endpoint не подтверждают право использовать сервис. Перед передачей данных и интеграцией нужна проверка применимости условий к конкретному человеку, работодателю и заказчику.

Условия OpenRouter и его providers тоже включают географические и санкционные ограничения. Проверять надо обе ступени: договор агрегатора и правила фактического поставщика модели.

Нулевая цена токенов не отменяет комиссии и лицензии

OpenRouter не делает наценку на цену inference, но берет 5,5% при покупке credits, минимум $0,80 за пополнение. Покупка от $10 повышает дневной free-лимит, но эти деньги остаются prepaid balance. Неиспользованные credits платформа вправе погасить через 365 дней. Запросить возврат можно в первые 24 часа; platform fee не возвращается, crypto-платежи не возвращаются.

TokenRouter сейчас заявляет нулевую platform fee за функции Personal и Enterprise и отсутствие своей processing fee для Stripe. Это не исключает налоги, валютную конвертацию и банковские сборы. Пополнения по умолчанию невозвратны; исключительный возврат могут уменьшить на upstream costs, налоги, потери на обмене валют и комиссии. Срок обычного денежного баланса публично не указан.

Лицензия модели — еще один независимый слой:

Пример open-weight-модели Лицензия Что это показывает
GLM-5.3 Собственная GLM-5.3 License Разрешает коммерческое использование и модификацию, но требует notice; для Model-as-a-Service бизнеса с выручкой свыше $10 млрд есть security review
Qwen3-32B Apache 2.0 Есть условия сохранения copyright/license notice и патентные положения
Llama 3.3 Llama 3.3 Community License Действуют attribution, Acceptable Use Policy и особое условие для продуктов свыше 700 млн активных пользователей в месяц

У разных версий одной семьи лицензии могут различаться. Цена $0 за API-вызов не выдает автоматическое право обучать заменяющую модель, продавать веса или игнорировать acceptable-use policy. Для synthetic data и distillation нужны условия точного checkpoint и provider.

Что выбрать для разных задач

Сценарий Бесплатный роутер Платный API Локальная модель
Учеба и знакомство с API Лучший старт на несекретных данных Нужен только для конкретной закрытой модели Полезен для изучения inference, но требует настройки
Прототип на синтетических данных Подходит при retry и сменном model ID Нужен перед демонстрацией с предсказуемым качеством Подходит, если железо уже есть
Приватный код и документы Только после проверки ZDR, provider, региона и логов Обычно проще получить ясный коммерческий контракт Максимальный контроль при изолированной инфраструктуре
Продакшен для пользователей Не использовать как единственный primary Основной выбор с бюджетом, наблюдаемостью и SLA либо SLO Подходит команде, готовой обслуживать GPU и отказоустойчивость
Batch и агентные циклы Быстро упирается в RPD/concurrency; повторы непредсказуемы Удобен при известной цене, batch-контракте и idempotency Нет внешней квоты, но throughput ограничен своим оборудованием
Датасет, fine-tuning, distillation Нужна отдельная проверка лицензии и права на outputs Оплата не отменяет ограничений лицензии Больше технического контроля, те же лицензионные обязанности

Локальный запуск тоже не бесплатен. Его стоимость складывается из GPU или аренды, электричества, диска, обновлений, мониторинга и времени инженера. Он выигрывает не всегда по деньгам, зато сокращает число внешних обработчиков и дает контроль над checkpoint, логами и графиком обновлений.

Чек-лист классификации данных перед первым запросом

Сначала определите класс данных. Затем подбирайте маршрут; обратный порядок приводит к утечкам.

Класс Примеры Допустимый маршрут
Зеленый Публичный текст, синтетический код, вымышленные записи Free при принятии нестабильности
Желтый Закрытый, но обезличенный черновик; внутренний код без секретов Закрепленный provider, no-training, подходящий retention и регион
Красный API-ключи, .env, пароли, токены, приватные ключи Не отправлять модели вообще
Красный регулируемый Персональные, медицинские, финансовые данные, документы клиентов Только утвержденный договором маршрут с DPA/residency либо локальный контур
Красный бизнес Неопубликованный алгоритм, договор, исходники клиента, incident dump Локальный контур или прошедший vendor/security review provider

Перед отправкой проверьте семь пунктов:

  • нет ли в prompt секретов и персональных данных;
  • известен ли фактический provider, а не только агрегатор;
  • запрещены ли training и долговременное хранение;
  • подходит ли регион обработки и договорная доступность;
  • выключены ли optional logs, history, files и cache, если они не нужны;
  • разрешает ли лицензия модели коммерческий сценарий и distillation;
  • можно ли удалить сохраненные данные и подтвердить срок retention.

Как воспроизводимо проверить надежность и качество

Нельзя измерить реальную надежность сервиса без запросов. Но можно заранее подготовить тест, который не меняется между providers, и выполнить его позже через разрешенный интерфейс. В рамках этого разбора запросы к API не выполнялись.

Подготовьте фиксированный набор

Возьмите 20–30 обезличенных заданий из реальной нагрузки:

  • пять коротких вопросов с проверяемым ответом;
  • пять задач на код с unit-тестами;
  • пять длинных входов у планового размера контекста;
  • пять заданий на строгий JSON и tool calls;
  • пять провокаций на отказ, prompt injection и утечку system prompt.

Зафиксируйте system prompt, temperature, seed при поддержке, лимит output, schema и критерий успеха. Секреты замените маркерами. Для каждого задания сохраните ожидаемые свойства, а не единственную «идеальную» формулировку.

Проведите одинаковые серии

Каждый маршрут прогоняют не менее 30 раз в три временных окна: обычная нагрузка, вечерний пик и выходной. Записывают дату, requested model, actual model/provider, quantization при наличии, latency до первого токена, полное время, input/output tokens, finish reason, HTTP/SSE error, число retries и списание.

Метрика Минимальная проверка
Успешность Доля полностью завершенных ответов, отдельно после retry
Задержка p50, p95 и p99, а не только среднее
Качество Unit-тесты, JSON Schema, factual checklist, blind review
Стабильность модели Доля запросов с тем же actual model/provider
Контекст Точное извлечение маркеров из начала, середины и конца входа
Стоимость Фактическое списание, в том числе reasoning/cache/retry
Privacy Совпадение route с требуемыми ZDR/no-training/region правилами

Сравнивать openrouter/free как одну модель нельзя: случайный выбор смешает разные системы. Для эксперимента сохраняйте actual model и анализируйте результаты по каждой модели отдельно. Если TokenRouter не раскрывает provider или checkpoint, пометьте столбец Unknown — это результат проверки, а не пропуск.

Для решения о продакшене заранее задайте пороги, например: success rate не ниже 99,5%, p95 до 8 секунд, валидный JSON в 99,9% случаев, ноль платных fallback и ноль нарушений data policy. Бесплатный маршрут, не прошедший порог, остается инструментом разработки.

Ограничители бюджета, которые стоит включить заранее

Даже при тестировании Free нужен финансовый предохранитель:

  • отдельный API key на проект и среду;
  • минимальный per-key или workspace budget, если платформа его поддерживает;
  • max_price: 0 для строго бесплатных запросов OpenRouter;
  • выключенный auto top-up до подтверждения экономики;
  • уведомления на 50%, 80% и 100% месячного бюджета;
  • явный allowlist model IDs и providers вместо автоматического paid fallback;
  • верхний предел retries и exponential backoff;
  • ежедневная сверка usage logs с собственным request ID;
  • отдельный аварийный лимит, который нельзя расходовать batch-задачей.

Для TokenRouter не найден публичный контракт, гарантирующий бесплатный fallback и личный hard cap для каждого key. Если панель не дает строгого нулевого лимита расходов, безопаснее не держать крупный баланс на ключе экспериментальной среды и не включать совместимую подмену до письменного подтверждения.

План миграции, если бесплатная модель исчезнет

Зависимость от Free стоит проектировать как заменяемую с первого дня.

  1. Вынесите base URL, model ID, provider policy и лимиты в конфигурацию, не зашивайте их в бизнес-логику.
  2. Используйте минимальное общее подмножество API: messages, streaming, tools и errors нормализуйте собственным adapter.
  3. Храните обезличенный golden set и пороги качества из теста выше.
  4. Подготовьте два резерва: дешевый платный endpoint и локальную open-weight-модель подходящего размера.
  5. Перед переключением выполните shadow-сравнение на одних и тех же входах, проверьте JSON, tool calls, latency и стоимость.
  6. Включайте новый маршрут по доле трафика, начиная с внутренних задач. Не отправляйте один и тот же чувствительный prompt двум providers без разрешения.
  7. После cutover оставьте rollback, обновите privacy register, лицензионные notices и мониторинг фактического model/provider.

Совместимый формат OpenAI API упрощает замену URL, но не гарантирует совместимость поведения. Самые частые поломки происходят в streaming, tool calls, structured output, token counting и обработке ошибок.

Вывод

Бесплатные модели OpenRouter дают понятную квоту: 20 запросов в минуту и 50 в сутки, либо 1000 в сутки после покупки минимум $10 credits. Цена токенов остается нулевой, но покупка credits включает 5,5% fee, а свободная upstream-мощность не гарантирована.

У TokenRouter подтвержден как минимум один отдельный free SKU с нулевой ценой, но его точные RPM, TPM, суточный лимит, правило нулевого баланса и endpoint-specific privacy публично не раскрыты. Общая concurrency зависит от текущего баланса, а free compute работает без гарантии стабильности. Для сторон из России и Беларуси дополнительно действует договорное ограничение, способное исключить сервис независимо от цены.

Используйте Free для обучения, одноразовых задач и прототипов на публичных или синтетических данных. Платный API выбирайте для предсказуемой нагрузки и коммерческой поддержки. Локальный inference нужен там, где контроль данных, версии модели и доступности важнее простоты подключения. Для более широкого сравнения маршрутов и провайдеров пригодится обзор агрегаторов нейросетей для пользователей из России.

Автор статьи

Елена Кравцова — Редактор и автор статей
Елена Кравцова

Редактор и автор статей

Пишет экспертные материалы о цифровом маркетинге и автоматизации. Журналист с опытом в деловых медиа, отвечает за качество и достоверность публикаций.

Вопросы и ответы

Конкретный model ID с :free имеет нулевую цену токенов. Списание возможно, если приложение выбрало другой, платный ID или разрешило платный fallback. Для строгого режима задайте allowlist и max_price: 0, затем проверяйте usage logs.

openrouter/free случайно выбирает подходящую модель из бесплатного пула. Суффикс :free запрашивает бесплатный вариант конкретного семейства. Для воспроизводимого качества нужен конкретный ID и, по возможности, закрепленный provider.

Покупка не является платой за free-токены. Она повышает общую суточную квоту с 50 до 1000 запросов. При пополнении взимается 5,5% fee с минимумом $0,80, а credits можно расходовать на платные модели.

На 6 сентября 2026 года единые RPM, TPM, RPD и суточный token cap публично не найдены. Известны динамические уровни concurrency по текущему балансу и предупреждение free-модели о негарантированной мощности. Числа из отзывов нельзя считать тарифом.

Да. Бесплатный endpoint может быть промоакцией или зависеть от выделенной provider-мощности. Храните model ID в конфигурации, готовьте платный и локальный резерв и повторяйте golden-тест перед заменой.

Не гарантировано. Они могут работать у разных providers, с другой quantization, checkpoint, context/output limit и поддержкой tools. Сравнивайте actual endpoint на одинаковом наборе заданий.

Некоторые могут, многие заявляют no-training, у части срок хранения неизвестен. Проверяйте политику конкретного endpoint. Общий статус агрегатора не заменяет правила upstream-провайдера.

Не целиком и не по умолчанию. Сначала удалите секреты, определите владельца данных, потребуйте ZDR/no-training, проверьте provider, регион и retention. Для клиентского либо критичного кода безопаснее утвержденный платный маршрут или локальный контур.

Только для небольшого некритичного объема. Суточные квоты, concurrency, очередь и retries делают срок завершения непредсказуемым. Поддержка free SKU в отдельном Batch API OpenRouter и правила учета его элементов публично не подтверждены; у TokenRouter публичный batch-контракт не найден.

Договорного SLA для Free не найдено. OpenRouter оставляет contractual SLA Enterprise-тарифу. TokenRouter называет высокий uptime целью, но его Terms прямо исключают гарантию и service credits без отдельного подписанного соглашения.

При небольшой и меняющейся нагрузке обычно проще платный API: нет капитальных затрат и обслуживания GPU. При постоянном большом объеме или строгой изоляции локальный inference может выиграть, но считать нужно полную стоимость оборудования, энергии, мониторинга и работы инженера.

Смотрите также

Поделиться

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению