К списку моделей
Логотип DeepSeek, разработчика R1 Distill Llama 70B

R1 Distill Llama 70B

От DeepSeek

Open Source
FAMDeepSeek
CTX131K
PAR70B
Релиз: 2025-01-23
StandardGeneralTextOpen WeightsLocal

Краткое описание

DeepSeek R1 Distill Llama 70B — это дистиллированная модель большого языка, основанная на [Llama-3.3-70B-Instruct](/meta-llama/llama-3.3-70b-instruct) с использованием результатов из [DeepSeek R1](/deepseek/deepseek-r1). Модель сочетает в себе передовые методы дистилляции для достижения высокой производительности во всем...

Агрегированный профиль

R1 Distill Llama 70B сильнее всего выглядит в категории «рассуждения». Индекс 63/100 рассчитан по процентильным позициям в 3 сопоставимых тестах; уверенность — средняя. Это навигационная оценка, а не замена тесту на ваших задачах.

Рассуждения63/100

3 сопоставимых теста · уверенность: средняя

Код59/100

2 сопоставимых теста · уверенность: средняя

Как рассчитан профиль →

Место модели в каталоге

Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.

БенчмаркРезультатМестоДоказательство
Arena Elo (LMSYS)1405227 из 382Источник не указан
MMLU (Общие знания)85.4%226 из 389Источник не указан
HumanEval (Кодинг)86.4%197 из 389Источник не указан
MATH (Математика)91.3%89 из 389Источник не указан
GPQA (Экспертные знания)69.3%114 из 388Источник не указан
SWE-bench (Разработка)58.1%122 из 379Источник не указан

Подробный обзор модели

DeepSeek R1 Distill Llama 70B — это высокопроизводительная языковая модель с открытыми весами, представляющая собой результат глубокой дистилляции знаний из флагманской модели DeepSeek R1 в архитектуру Llama 3.3 70B Instruct. Представленная в январе 2025 года, эта модель объединяет в себе феноменальные способности к рассуждению (reasoning) от R1 с надежностью и эффективностью популярного семейства Llama, предлагая пользователям интеллект уровня o1-preview в компактном и быстром 70B формате.

Особенности и метод дистилляции

Модель была создана командой DeepSeek путем обучения Llama 3.3 70B на огромном массиве данных, включающем «цепочки мыслей» (thinking traces), сгенерированные флагманской моделью DeepSeek R1.

  • Интеллектуальный прорыв в 70B: Благодаря дистилляции, модель получила способности к пошаговому анализу сложных задач, которые ранее были доступны только гигантским моделям на 600B+ параметров. Она умеет проводить внутреннюю верификацию ответов и находить неочевидные решения.
  • Мастерство математики и логики: DeepSeek R1 Distill Llama 70B демонстрирует выдающиеся результаты в STEM-дисциплинах, значительно превосходя базовую Llama 3.3 в задачах на логический вывод и математическое моделирование.
  • Эффективный инференс: Размер в 70 миллиардов параметров позволяет модели работать быстро и эффективно на современных GPU-кластерах, обеспечивая отличный баланс между глубиной рассуждений и скоростью генерации.

Производительность и бенчмарки

Модель уверенно занимает топовые позиции в рейтингах систем среднего веса, соревнуясь с лучшими закрытыми аналогами в точности логического вывода.

БенчмаркРезультатОписание
MATH91.3%Исключительная точность в математических рассуждениях (премиум)
Arena Elo1405Высокий профессиональный уровень
HumanEval86.4%Высокое качество генерации программного кода
MMLU85.4%Глубокие общие знания и эрудиция
GPQA69.3%Научные вопросы PhD-уровня
SWE_bench58.1%Решение инженерных задач в реальных условиях

Ценообразование и доступность

Модель доступна в виде открытых весов и через API популярных агрегаторов (например, OpenRouter) по крайне привлекательной цене: всего $0.70 за 1M входных токенов и $0.80 за 1M выходных токенов. Это делает её одним из самых выгодных решений для систем, требующих глубокого рассуждения за минимальную стоимость.

Идеальные сценарии применения (Use Cases)

  • Глубокие научные и технические исследования: Помощь в анализе данных, проверке гипотез и решении сложных уравнений.
  • Профессиональный кодинг и аудит: Использование способностей к рассуждению для отладки сложной логики и проектирования систем.
  • Интеллектуальные RAG-системы: Построение надежных систем ответов на вопросы, требующих пошагового анализа предоставленного контекста.

Плюсы и минусы

Плюсы:

  • Интеллект «рассуждающих» флагманов в 70B формате.
  • Феноменальная точность в математике и логике.
  • Открытые веса (база Llama 3.3).
  • Очень выгодная стоимость API.

Минусы:

  • Требует значительных мощностей для локального запуска.
  • Цепочки мыслей модели могут быть менее подробными, чем у оригинальной DeepSeek R1 671B.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

Стоимость API

$0.70 / $0.80 за 1M токенов

Профиль модели

MMLU85.4%Code86.4%Math91.3%GPQA69.3%SWE58.1%

Бенчмарки

Arena Elo (LMSYS)1405
MMLU (Общие знания)85.4%
HumanEval (Кодинг)86.4%
MATH (Математика)91.3%
GPQA (Экспертные знания)69.3%
SWE-bench (Разработка)58.1%

Другие модели семейства DeepSeek

Экосистема R1 Distill Llama 70B

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Обсуждения о R1 Distill Llama 70B

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение