К списку моделей
Логотип Meta, разработчика Llama 3.2 11B Vision Instruct

Llama 3.2 11B Vision Instruct

От Meta

Open Source
FAMLlama
CTX131K
PAR11B
Релиз: 2024-09-25
StandardGeneralMultimodalOpen WeightsLocalImage Input
* Продукт компании Meta Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Краткое описание

Llama 3.2 11B Vision — мультимодальная модель с 11 миллиардами параметров, предназначенная для решения задач, объединяющих визуальные и текстовые данные. Он превосходно справляется с такими задачами, как создание подписей к изображениям и...

Агрегированный профиль

Llama 3.2 11B Vision Instruct сильнее всего выглядит в категории «код». Индекс 69/100 рассчитан по процентильным позициям в 2 сопоставимых тестах; уверенность — средняя. Это навигационная оценка, а не замена тесту на ваших задачах.

Код69/100

2 сопоставимых теста · уверенность: средняя

Рассуждения47/100

3 сопоставимых теста · уверенность: средняя

Как рассчитан профиль →

Место модели в каталоге

Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.

БенчмаркРезультатМестоДоказательство
Arena Elo (LMSYS)1416197 из 384Источник не указан
MMLU (Общие знания)86.3%195 из 391Источник не указан
HumanEval (Кодинг)88.2%164 из 391Источник не указан
MATH (Математика)87.9%144 из 391Источник не указан
GPQA (Экспертные знания)63.4%272 из 390Источник не указан
SWE-bench (Разработка)61.8%75 из 381Источник не указан

Подробный обзор модели

Llama 3.2 11B Vision Instruct — это высокопроизводительная мультимодальная языковая модель от компании Meta, представленная в сентябре 2024 года. С 11 миллиардами параметров, эта модель специально разработана для решения задач, требующих одновременного понимания визуальной и текстовой информации. Llama 3.2 11B является идеальным «мозгом» для интерактивных ассистентов, способных «видеть» и анализировать окружающий мир, предлагая возможности флагманского уровня при высокой скорости работы.

Архитектура и мультимодальные возможности

Модель построена на базе обновленной архитектуры Llama 3.2, включающей нативные слои обработки визуальных данных.

  • Интеллектуальное зрение: Llama 3.2 11B Vision мастерски справляется с описанием изображений, распознаванием объектов и извлечением текста из визуальных источников. Она умеет находить тонкие связи между текстовым запросом и графическим контентом, обеспечивая высокую точность ответов.
  • Работа с документами и схемами: Модель была оптимизирована для анализа сложных визуальных макетов (PDF-файлы, графики, чертежи), преобразуя визуальную информацию в структурированный текст.
  • Широкий контекст 131K: Поддержка контекстного окна до 131 072 токенов позволяет модели анализировать не только отдельные кадры, но и целые пакеты документов или длительные мультимедийные сессии за один проход.

Производительность и бенчмарки

Llama 3.2 11B Vision Instruct устанавливает новые стандарты для открытых мультимодальных моделей среднего размера, показывая выдающиеся результаты в тестах на общие знания и логику.

БенчмаркРезультатОписание
Arena Elo1416Топ-уровень для 11B мультимодальных моделей
HumanEval88.2%Высокое качество генерации программного кода
MATH87.9%Сильные способности в математике и логике
MMLU86.3%Глубокие общие знания и эрудиция
GPQA63.4%Научные тесты PhD-уровня
SWE_bench61.8%Решение инженерных задач в реальных условиях

Ценообразование и доступность

Модель доступна в виде открытых весов (Open-Source) и через API популярных агрегаторов по крайне привлекательной цене: всего $0.24 за 1M токенов (как на вход, так и на выход). Это делает Llama 3.2 11B одним из самых экономически эффективных решений для масштабных мультимодальных приложений.

Идеальные сценарии применения (Use Cases)

  • Интерактивные Vision-ассистенты: Создание помощников для смартфонов и веб-приложений, способных анализировать фото и видео в реальном времени.
  • Автоматизированный парсинг данных: Извлечение информации из сканов документов, чеков и технических чертежей с высокой точностью.
  • Помощь в дизайне и UI/UX: Визуальный аудит интерфейсов и помощь в проектировании на основе графических входных данных.

Плюсы и минусы

Плюсы:

  • Рекордная производительность для модели на 11B параметров.
  • Нативная поддержка анализа изображений высшего уровня.
  • Очень выгодная стоимость использования через API.
  • Открытый доступ к технологиям Meta.

Минусы:

  • Ограниченная глубина философских рассуждений по сравнению со старшей версией 70B.
  • Требует специфической настройки инференса для оптимальной работы со зрением.

Где запустить модель

Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.

Обновляем провайдеров и цены…

На чём запустили?

Реальные замеры сообщества и помеченные редакционные ориентиры для локального запуска Llama 3.2 11B Vision Instruct.

Сначала оцените, поместится ли выбранная квантизация в вашу RAM или VRAM.

Калькулятор локальных LLM

Для этой модели пока нет одобренных замеров.

Если вы запускали её локально, поделитесь конфигурацией — после проверки она появится здесь.

Скорость зависит от версии рантайма, драйверов, длины контекста и настроек. Редакционные значения — ориентир, а не гарантированный результат.

Стоимость API

$0.24 / $0.24 за 1M токенов

Профиль модели

MMLU86.3%Code88.2%Math87.9%GPQA63.4%SWE61.8%

Бенчмарки

Arena Elo (LMSYS)1416
MMLU (Общие знания)86.3%
HumanEval (Кодинг)88.2%
MATH (Математика)87.9%
GPQA (Экспертные знания)63.4%
SWE-bench (Разработка)61.8%

Другие модели семейства Llama

Экосистема Llama 3.2 11B Vision Instruct

Сервисы, инструменты, материалы и обсуждения, связанные с моделью.

Сервисы с поддержкой модели

Откройте результаты по названию модели и проверьте актуальную интеграцию.

Искать в /services/ →

MCP и инструменты

Весь каталог

Точных связей пока нет. Искать по разработчику.

Обсуждения о Llama 3.2 11B Vision Instruct

Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.

Создать обсуждение