Текущая2025-01-20

От DeepSeek
DeepSeek R1 — это мощная модель с открытыми весами (671B MoE), сопоставимая по возможностям рассуждения с OpenAI o1. Она предлагает прозрачный процесс мышления и выдающиеся результаты в математике и программировании.
Для R1 пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| GPQA (Экспертные знания) | 61.7% | н/д | Источник не указан |
| MATH (Математика) | 80.1% | н/д | Источник не указан |
| MMLU (Общие знания) | 86.6% | н/д | Источник не указан |
| Arena Elo (LMSYS) | 1419 | н/д | Источник не указан |
| HumanEval (Кодинг) | 82.5% | н/д | Источник не указан |
| SWE-bench (Разработка) | 45.9% | н/д | Источник не указан |
DeepSeek R1 — это флагманская модель с открытыми весами от китайской лаборатории DeepSeek, которая вызвала мировую сенсацию в начале 2025 года. Она стала первым реальным конкурентом проприетарной модели OpenAI o1, предложив сопоставимый уровень логических рассуждений, математических способностей и навыков программирования при радикально меньшей стоимости. R1 доказала, что сложные цепочки рассуждений (Chain of Thought) могут быть эффективно реализованы и в open-source сегменте.
Модель DeepSeek R1 построена на архитектуре Mixture-of-Experts (MoE) и содержит внушительные 671 миллиард параметров. Однако благодаря MoE-подходу, в процессе генерации каждого токена активируются лишь 37 миллиардов параметров, что обеспечивает высокую скорость работы и эффективность.
Ключевым технологическим прорывом стал метод обучения GRPO (Group Relative Policy Optimization). В отличие от традиционных алгоритмов обучения с подкреплением, GRPO не требует отдельной модели-критика, что вдвое снижает затраты на вычислительные ресурсы. Обучение проходило в два этапа: сначала «холодный старт» на высококачественных данных рассуждений, а затем масштабное обучение с подкреплением (RL), которое научило модель «думать перед тем, как говорить», не смешивая языки и соблюдая четкую структуру ответов.
DeepSeek R1 идет ноздря в ноздрю с OpenAI o1, а в некоторых дисциплинах даже превосходит ее.
Одной из уникальных особенностей R1 является полная прозрачность «токенов рассуждения». Пользователь может видеть весь процесс мыслительной деятельности модели в реальном времени, что критически важно для отладки и проверки логики в научных и инженерных задачах.
DeepSeek R1 полностью меняет экономику использования ИИ. Пока конкуренты устанавливают высокие цены на рассуждающие модели, DeepSeek предлагает экстремальную доступность:
Это примерно в 20–25 раз дешевле, чем использование OpenAI o1 при сопоставимом качестве ответов. Более того, модель выпущена под лицензией MIT, что позволяет компаниям не только бесплатно использовать ее в коммерческих целях, но и проводить дистилляцию — обучать собственные меньшие модели на ответах R1.
DeepSeek R1 — это прежде всего «думающая» модель, поэтому ее стоит использовать там, где важна логика, а не просто генерация текста:
Плюсы:
Минусы:
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
История семейства
Последовательность собрана по датам релиза моделей DeepSeek в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.