К списку моделей
Логотип DeepSeek, разработчика R1 Distill Llama 70B

R1 Distill Llama 70B

G-Score: н/д

От DeepSeek

Open Source
FAMDeepSeek
CTX131K
PAR70B
Релиз: 2025-01-23
StandardGeneralTextOpen WeightsLocal

Краткое описание

DeepSeek R1 Distill Llama 70B — это дистиллированная модель большого языка, основанная на [Llama-3.3-70B-Instruct](/meta-llama/llama-3.3-70b-instruct) с использованием результатов из [DeepSeek R1](/deepseek/deepseek-r1). Модель сочетает в себе передовые методы дистилляции для достижения высокой производительности во всем...

G-Score и профиль

G-Score: н/д

Для R1 Distill Llama 70B пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

низкая

Покрытие

0 тестов · 0 направлений

Происхождение

нет данных лидербордов

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
GPQA (Экспертные знания)69.3%н/дИсточник не указан
MATH (Математика)91.3%н/дИсточник не указан
MMLU (Общие знания)85.4%н/дИсточник не указан
Arena Elo (LMSYS)1405н/дИсточник не указан
HumanEval (Кодинг)86.4%н/дИсточник не указан
SWE-bench (Разработка)58.1%н/дИсточник не указан

Подробный обзор модели

DeepSeek R1 Distill Llama 70B — это высокопроизводительная языковая модель с открытыми весами, представляющая собой результат глубокой дистилляции знаний из флагманской модели DeepSeek R1 в архитектуру Llama 3.3 70B Instruct. Представленная в январе 2025 года, эта модель объединяет в себе феноменальные способности к рассуждению (reasoning) от R1 с надежностью и эффективностью популярного семейства Llama, предлагая пользователям интеллект уровня o1-preview в компактном и быстром 70B формате.

Особенности и метод дистилляции

Модель была создана командой DeepSeek путем обучения Llama 3.3 70B на огромном массиве данных, включающем «цепочки мыслей» (thinking traces), сгенерированные флагманской моделью DeepSeek R1.

  • Интеллектуальный прорыв в 70B: Благодаря дистилляции, модель получила способности к пошаговому анализу сложных задач, которые ранее были доступны только гигантским моделям на 600B+ параметров. Она умеет проводить внутреннюю верификацию ответов и находить неочевидные решения.
  • Мастерство математики и логики: DeepSeek R1 Distill Llama 70B демонстрирует выдающиеся результаты в STEM-дисциплинах, значительно превосходя базовую Llama 3.3 в задачах на логический вывод и математическое моделирование.
  • Эффективный инференс: Размер в 70 миллиардов параметров позволяет модели работать быстро и эффективно на современных GPU-кластерах, обеспечивая отличный баланс между глубиной рассуждений и скоростью генерации.

Производительность и бенчмарки

Модель уверенно занимает топовые позиции в рейтингах систем среднего веса, соревнуясь с лучшими закрытыми аналогами в точности логического вывода.

БенчмаркРезультатОписание
MATH91.3%Исключительная точность в математических рассуждениях (премиум)
Arena Elo1405Высокий профессиональный уровень
HumanEval86.4%Высокое качество генерации программного кода
MMLU85.4%Глубокие общие знания и эрудиция
GPQA69.3%Научные вопросы PhD-уровня
SWE_bench58.1%Решение инженерных задач в реальных условиях

Ценообразование и доступность

Модель доступна в виде открытых весов и через API популярных агрегаторов (например, OpenRouter) по крайне привлекательной цене: всего $0.70 за 1M входных токенов и $0.80 за 1M выходных токенов. Это делает её одним из самых выгодных решений для систем, требующих глубокого рассуждения за минимальную стоимость.

Идеальные сценарии применения (Use Cases)

  • Глубокие научные и технические исследования: Помощь в анализе данных, проверке гипотез и решении сложных уравнений.
  • Профессиональный кодинг и аудит: Использование способностей к рассуждению для отладки сложной логики и проектирования систем.
  • Интеллектуальные RAG-системы: Построение надежных систем ответов на вопросы, требующих пошагового анализа предоставленного контекста.

Плюсы и минусы

Плюсы:

  • Интеллект «рассуждающих» флагманов в 70B формате.
  • Феноменальная точность в математике и логике.
  • Открытые веса (база Llama 3.3).
  • Очень выгодная стоимость API.

Минусы:

  • Требует значительных мощностей для локального запуска.
  • Цепочки мыслей модели могут быть менее подробными, чем у оригинальной DeepSeek R1 671B.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$0.70 / $0.80 за 1M токенов

Рассчитать сценарий →

Профиль модели

MMLU85.4%Code86.4%Math91.3%GPQA69.3%SWE58.1%

Бенчмарки

GPQA (Экспертные знания)69.3%
MATH (Математика)91.3%
MMLU (Общие знания)85.4%
Arena Elo (LMSYS)1405
HumanEval (Кодинг)86.4%
SWE-bench (Разработка)58.1%

История семейства

Линейка DeepSeek

Последовательность собрана по датам релиза моделей DeepSeek в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема R1 Distill Llama 70B

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

Сервисы с поддержкой модели

Откройте результаты по названию модели и проверьте актуальную интеграцию.

Искать в /services/ →

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Статьи и термины

Все статьи

Обсуждения о R1 Distill Llama 70B

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение