Текущая2026-08-31

От Inception
Mercury 2.5 Preview — diffusion LLM от Inception, которая уточняет группы токенов параллельно вместо строго последовательной генерации. Провайдер заявляет скорость до 1 107 токенов в секунду на стандартных GPU. Модель поддерживает reasoning levels, параллельные tool calls, JSON Schema, контекст 260K и вывод до 65 536 токенов, но остаётся preview-релизом.
Для Mercury 2.5 Preview пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Mercury 2.5 Preview стоит тестировать там, где задержка складывается из десятков вызовов модели: в поисковых агентах, интерактивной разработке, голосовых конвейерах и службах поддержки. Модель выдаёт текст необычно быстро и на старте продаётся с большой скидкой, но статус Preview требует осторожности: независимых сопоставимых бенчмарков качества пока нет, доступен один провайдер, а опубликованные 1 107 токенов в секунду не описывают скорость любого реального запроса.
Inception Labs выпустила модель через OpenRouter 31 августа 2026 года. Её API-идентификатор — inception/mercury-2.5-preview. Это закрытая текстовая reasoning-модель: веса, число параметров и дата среза знаний не опубликованы. Она принимает и возвращает текст, поэтому изображения, аудио и видео нужно обрабатывать отдельными моделями.
Mercury 2.5 относится к diffusion large language models, или диффузионным языковым моделям. Обычная авторегрессионная модель дописывает ответ слева направо по одному токену. Mercury начинает с зашумлённого представления будущего ответа и несколькими проходами уточняет сразу множество позиций. Нейросеть-денойзер остаётся Transformer-моделью; «диффузия» описывает способ обучения и генерации, а не превращает текстовую модель в генератор изображений.
Параллельное уточнение лучше загружает графический процессор и сокращает фазу декодирования. Оно не устраняет другие задержки: чтение длинного промпта, ожидание первого содержательного токена, сетевой путь, выполнение инструментов и повторные шаги агента остаются последовательными. Сам принцип также не доказывает более высокую точность и не гарантирует автоматическое исправление галлюцинаций.
На 7 сентября 2026 года карточка и публичный каталог OpenRouter указывают такую конфигурацию:
| Параметр | Значение |
|---|---|
| Контекстное окно | 260 000 токенов |
| Максимальный вывод | 65 536 токенов |
| Вход и выход | текст → текст |
| Reasoning | включён по умолчанию; none, low, medium, high |
| Инструменты | function calling, tool_choice, параллельные вызовы по заявлению карточки модели |
| Структурированный ответ | response_format, JSON Schema |
| Потоковая выдача | поддерживается |
| Провайдер маршрута | только Inception |
Контекст включает историю, инструкции, определения инструментов и ответ. Поэтому нельзя одновременно отправить 260 тысяч входных токенов и запросить ещё 65 536 токенов вывода. В приложении следует заранее оставлять запас под reasoning, аргументы функций и финальный ответ.
API совместим с форматом Chat Completions. Через OpenRouter достаточно сменить slug модели, но совместимость не равна полной взаимозаменяемости. Перед миграцией нужно проверить роли сообщений, схему reasoning, поддержанные параметры и обработку потоковых событий.
Уровень none подходит для короткой классификации и преобразования текста, low — для быстрых диалогов и простых вызовов функций, medium служит базовым режимом, а high оставляет модели больше вычислений для многошаговой задачи. Reasoning-токены влияют на время и расход, поэтому уровень лучше выбирать по собственному eval-набору, а не держать high для всех запросов.
Модель может вызвать функции и вернуть JSON по схеме, однако приложение всё равно должно проверять аргументы, лимитировать число шагов и подтверждать необратимые операции. Карточка Mercury 2.5 обещает параллельные tool calls, тогда как публичная документация прямого Inception API всё ещё описывает Mercury 2 и только последовательные вызовы. Это различие нужно проверить на используемом маршруте до проектирования агента.
До 8 сентября 2026 года, 07:00 UTC, OpenRouter показывает скидку 80%:
| Операция | Акционная цена за 1 млн токенов | Базовая цена Inception |
|---|---|---|
| Вход | $0,04 | $0,20 |
| Кэшированный вход | $0,004 | $0,02 |
| Выход | $0,15 | $0,75 |
Запрос со 100 тысячами входных и 10 тысячами выходных токенов стоит около $0,0055 по акции и $0,0275 по базовым ставкам, без учёта кэширования. После окончания акции расчёты, лимиты и фактическую цену маршрута нужно обновить. Взвешенная средняя цена на странице агрегатора зависит от попаданий в кэш и не заменяет тарифную таблицу.
Число 1 107 токенов/с публикуется в карточке Mercury 2.5 как достижение «на стандартных GPU». Там не указаны модель ускорителя, длина входа и ответа, reasoning effort, размер батча, параллельность и метод усреднения. Поэтому это воспроизводимое только поставщиком заявление, а не обещанный показатель API.
Есть более практичный, хотя изменчивый срез. На момент проверки 7 сентября OpenRouter показывал для единственного провайдера p50 throughput 322 токена/с и p50 latency 1,13 секунды; в недельном графике средние p50 составляли 309 токенов/с, а p50 end-to-end latency — 2,86 секунды. Эти цифры собирает маршрутизатор по реальному трафику, но они меняются с регионом, нагрузкой, длиной и режимом reasoning. Именно поэтому 322 и 1 107 не противоречат друг другу: это разные условия измерения.
Для Mercury 2 поставщик отдельно сообщал 1 009 токенов/с на NVIDIA Blackwell. Переносить результат базовой модели на 2.5 нельзя. Сравнивать модели стоит по времени до первого полезного токена, полному времени задачи, доле успешных tool calls и цене принятого результата.
На 7 сентября Inception не опубликовала таблицу сопоставимых результатов именно Mercury 2.5 Preview. На странице есть только заявление о приросте «более 10 пунктов интеллекта» относительно Mercury 2 и сравнении с GPT-5.6 Luna Low, Gemini 3.5 Flash-Lite и Claude Haiku 4.5, но нет названия индекса, набора задач, настроек reasoning и результатов конкурентов.
Страница OpenRouter также не показывает для модели данных Artificial Analysis по intelligence, coding или agentic benchmarks. Вторичные каталоги иногда присваивают Mercury 2.5 значения Mercury 2 или агрегатные индексы без проверяемой методологии. Такие цифры нельзя считать benchmark-пакетом новой preview-версии. Для выбора нужен собственный одинаковый набор: задачи на русском языке, функции и схемы проекта, правильность фактов, число повторов, p50/p95 задержки и стоимость успешного ответа.
В многошаговом поиске модель формирует запрос, читает найденное, уточняет поиск и собирает ответ. Экономия на каждом вызове суммируется. Но большой контекст не заменяет цитирование источников и проверку извлечённых фрагментов.
Быстрая генерация полезна для коротких циклов «прочитать — изменить — запустить тест». Mercury 2.5 является чат-моделью, поэтому специализированные автодополнение и next edit не следует приписывать ей по функциям Mercury Edit 2.
Модель может быстро подготовить текст реплики или подсказку оператору. Распознавание и синтез речи остаются отдельными звеньями, а p95 полной цепочки важнее рекордного throughput. Для ответа по внутренним данным нужны retrieval, права доступа и защита от выдуманных фактов.
Mercury 2.5 интересна, если продукту критичны быстрые длинные ответы, дешёвый текстовый API и частые агентные вызовы. Mercury 2 остаётся более зрелой точкой сравнения с контекстом 128K, выводом 50 тысяч токенов и базовой ценой $0,25/$0,75 за вход и выход.
Выбирать альтернативу разумно, если нужны изображения или аудио на входе, опубликованные независимые оценки качества, несколько взаимозаменяемых провайдеров, стабильный versioning либо подтверждённый SLA. У Mercury 2.5 пока один маршрут, неизвестны knowledge cutoff и параметры модели, а акционная цена заканчивается почти сразу после релиза. В production стоит закрепить контрольный набор, логировать версию и latency, ограничить инструменты и предусмотреть fallback.
Нет публичных весов или требований к локальному запуску. На дату обзора модель доступна как закрытый API через OpenRouter.
Это заявленный поставщиком результат без раскрытых условий. Наблюдаемая OpenRouter медиана на момент проверки была заметно ниже, поэтому измеряйте свой регион и тип запросов.
Начните с low для чувствительного к задержке потока и с medium для общих задач. high включайте только там, где eval показывает прирост качества; none проверяйте для простых преобразований.
Нет. Её опубликованная модальность — text-to-text. Для голосового продукта нужны отдельные speech-to-text и text-to-speech компоненты.
Сопоставимого model-specific набора пока нет. Опубликованные маркетинговые сравнения не раскрывают методику, а результаты Mercury 2 и Mercury Coder относятся к другим моделям.
Их поддержка заявлена, но preview-модель нужно проверить на ваших JSON Schema и функциях. Валидируйте результат программно и не разрешайте необратимые действия без внешнего контроля.
Базовые ставки Inception на 7 сентября 2026 года — $0,20 за 1 млн входных, $0,02 за кэшированный вход и $0,75 за 1 млн выходных токенов.
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Промо через OpenRouter: $0.04 / $0.15 за 1M токенов; заявленная базовая цена — $0.20 / $0.75
Рассчитать сценарий →Для диаграммы пока недостаточно сопоставимых тестов.
Сопоставимые числовые результаты пока не опубликованы. В каталоге они отмечены знаком «?», без оценочных значений.
История семейства
Последовательность собрана по датам релиза моделей Inception в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

2026-03-04
Текущая2026-08-31
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.