К списку моделей
Логотип Meta, разработчика Llama 3.2 11B Vision Instruct

Llama 3.2 11B Vision Instruct

G-Score1/100средняя#37 из 37Методология G-Score

От Meta

Open Source
FAMLlama
CTX131K
PAR11B
Релиз: 2024-09-25
StandardGeneralMultimodalOpen WeightsLocalImage Input
* Продукт компании Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Краткое описание

Llama 3.2 11B Vision — мультимодальная модель с 11 миллиардами параметров, предназначенная для решения задач, объединяющих визуальные и текстовые данные. Он превосходно справляется с такими задачами, как создание подписей к изображениям и...

G-Score и профиль

G-Score1/100средняя#37 из 37Методология G-Score

Llama 3.2 11B Vision Instruct сильнее всего выглядит в категории «общее качество». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.

Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.

Уверенность данных

средняя

Покрытие

2 теста · 2 направления

Происхождение

artificialAnalysis + lmarenaVision

G‑Общее качество2/100

1 тест · уверенность: средняя

G‑Зрение0/100

1 тест · уверенность: средняя

Как рассчитан профиль →

Место модели в каталоге

Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.

БенчмаркРезультатМестоДоказательство
GPQA (Экспертные знания)63.4%н/дИсточник не указан
MATH (Математика)87.9%н/дИсточник не указан
MMLU (Общие знания)86.3%н/дИсточник не указан
Arena Elo (LMSYS)1416н/дИсточник не указан
HumanEval (Кодинг)88.2%н/дИсточник не указан
SWE-bench (Разработка)61.8%н/дИсточник не указан

Подробный обзор модели

Llama 3.2 11B Vision Instruct — это высокопроизводительная мультимодальная языковая модель от компании Meta, представленная в сентябре 2024 года. С 11 миллиардами параметров, эта модель специально разработана для решения задач, требующих одновременного понимания визуальной и текстовой информации. Llama 3.2 11B является идеальным «мозгом» для интерактивных ассистентов, способных «видеть» и анализировать окружающий мир, предлагая возможности флагманского уровня при высокой скорости работы.

Архитектура и мультимодальные возможности

Модель построена на базе обновленной архитектуры Llama 3.2, включающей нативные слои обработки визуальных данных.

  • Интеллектуальное зрение: Llama 3.2 11B Vision мастерски справляется с описанием изображений, распознаванием объектов и извлечением текста из визуальных источников. Она умеет находить тонкие связи между текстовым запросом и графическим контентом, обеспечивая высокую точность ответов.
  • Работа с документами и схемами: Модель была оптимизирована для анализа сложных визуальных макетов (PDF-файлы, графики, чертежи), преобразуя визуальную информацию в структурированный текст.
  • Широкий контекст 131K: Поддержка контекстного окна до 131 072 токенов позволяет модели анализировать не только отдельные кадры, но и целые пакеты документов или длительные мультимедийные сессии за один проход.

Производительность и бенчмарки

Llama 3.2 11B Vision Instruct устанавливает новые стандарты для открытых мультимодальных моделей среднего размера, показывая выдающиеся результаты в тестах на общие знания и логику.

БенчмаркРезультатОписание
Arena Elo1416Топ-уровень для 11B мультимодальных моделей
HumanEval88.2%Высокое качество генерации программного кода
MATH87.9%Сильные способности в математике и логике
MMLU86.3%Глубокие общие знания и эрудиция
GPQA63.4%Научные тесты PhD-уровня
SWE_bench61.8%Решение инженерных задач в реальных условиях

Ценообразование и доступность

Модель доступна в виде открытых весов (Open-Source) и через API популярных агрегаторов по крайне привлекательной цене: всего $0.24 за 1M токенов (как на вход, так и на выход). Это делает Llama 3.2 11B одним из самых экономически эффективных решений для масштабных мультимодальных приложений.

Идеальные сценарии применения (Use Cases)

  • Интерактивные Vision-ассистенты: Создание помощников для смартфонов и веб-приложений, способных анализировать фото и видео в реальном времени.
  • Автоматизированный парсинг данных: Извлечение информации из сканов документов, чеков и технических чертежей с высокой точностью.
  • Помощь в дизайне и UI/UX: Визуальный аудит интерфейсов и помощь в проектировании на основе графических входных данных.

Плюсы и минусы

Плюсы:

  • Рекордная производительность для модели на 11B параметров.
  • Нативная поддержка анализа изображений высшего уровня.
  • Очень выгодная стоимость использования через API.
  • Открытый доступ к технологиям Meta.

Минусы:

  • Ограниченная глубина философских рассуждений по сравнению со старшей версией 70B.
  • Требует специфической настройки инференса для оптимальной работы со зрением.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

На чём запустили?

Реальные замеры сообщества и помеченные редакционные ориентиры для локального запуска Llama 3.2 11B Vision Instruct.

Сначала оцените, поместится ли выбранная квантизация в вашу RAM или VRAM.

Калькулятор локальных LLM

Для этой модели пока нет одобренных замеров.

Если вы запускали её локально, поделитесь конфигурацией — после проверки она появится здесь.

Скорость зависит от версии рантайма, драйверов, длины контекста и настроек. Редакционные значения — ориентир, а не гарантированный результат.

Стоимость API

$0.24 / $0.24 за 1M токенов

Рассчитать сценарий →

Профиль модели

MMLU86.3%Code88.2%Math87.9%GPQA63.4%SWE61.8%

Бенчмарки

GPQA (Экспертные знания)63.4%
MATH (Математика)87.9%
MMLU (Общие знания)86.3%
Arena Elo (LMSYS)1416
HumanEval (Кодинг)88.2%
SWE-bench (Разработка)61.8%

История семейства

Линейка Llama

Последовательность собрана по датам релиза моделей Meta в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.

Экосистема Llama 3.2 11B Vision Instruct

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

Сервисы с поддержкой модели

Откройте результаты по названию модели и проверьте актуальную интеграцию.

Искать в /services/ →

MCP и инструменты

Весь каталог

Обсуждения о Llama 3.2 11B Vision Instruct

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение