
От Meta
Llama 3.2 11B Vision — мультимодальная модель с 11 миллиардами параметров, предназначенная для решения задач, объединяющих визуальные и текстовые данные. Он превосходно справляется с такими задачами, как создание подписей к изображениям и...
Llama 3.2 11B Vision Instruct сильнее всего выглядит в категории «код». Индекс 69/100 рассчитан по процентильным позициям в 2 сопоставимых тестах; уверенность — средняя. Это навигационная оценка, а не замена тесту на ваших задачах.
2 сопоставимых теста · уверенность: средняя
3 сопоставимых теста · уверенность: средняя
Позиция рассчитана только среди моделей, для которых в каталоге указан результат того же теста. Это помогает сравнивать карточки, но не заменяет проверку модели на вашей задаче.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| Arena Elo (LMSYS) | 1416 | 197 из 384 | Источник не указан |
| MMLU (Общие знания) | 86.3% | 195 из 391 | Источник не указан |
| HumanEval (Кодинг) | 88.2% | 164 из 391 | Источник не указан |
| MATH (Математика) | 87.9% | 144 из 391 | Источник не указан |
| GPQA (Экспертные знания) | 63.4% | 272 из 390 | Источник не указан |
| SWE-bench (Разработка) | 61.8% | 75 из 381 | Источник не указан |
Llama 3.2 11B Vision Instruct — это высокопроизводительная мультимодальная языковая модель от компании Meta, представленная в сентябре 2024 года. С 11 миллиардами параметров, эта модель специально разработана для решения задач, требующих одновременного понимания визуальной и текстовой информации. Llama 3.2 11B является идеальным «мозгом» для интерактивных ассистентов, способных «видеть» и анализировать окружающий мир, предлагая возможности флагманского уровня при высокой скорости работы.
Модель построена на базе обновленной архитектуры Llama 3.2, включающей нативные слои обработки визуальных данных.
Llama 3.2 11B Vision Instruct устанавливает новые стандарты для открытых мультимодальных моделей среднего размера, показывая выдающиеся результаты в тестах на общие знания и логику.
| Бенчмарк | Результат | Описание |
|---|---|---|
| Arena Elo | 1416 | Топ-уровень для 11B мультимодальных моделей |
| HumanEval | 88.2% | Высокое качество генерации программного кода |
| MATH | 87.9% | Сильные способности в математике и логике |
| MMLU | 86.3% | Глубокие общие знания и эрудиция |
| GPQA | 63.4% | Научные тесты PhD-уровня |
| SWE_bench | 61.8% | Решение инженерных задач в реальных условиях |
Модель доступна в виде открытых весов (Open-Source) и через API популярных агрегаторов по крайне привлекательной цене: всего $0.24 за 1M токенов (как на вход, так и на выход). Это делает Llama 3.2 11B одним из самых экономически эффективных решений для масштабных мультимодальных приложений.
Плюсы:
Минусы:
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Реальные замеры сообщества и помеченные редакционные ориентиры для локального запуска Llama 3.2 11B Vision Instruct.
Сначала оцените, поместится ли выбранная квантизация в вашу RAM или VRAM.
Калькулятор локальных LLMДля этой модели пока нет одобренных замеров.
Если вы запускали её локально, поделитесь конфигурацией — после проверки она появится здесь.
Скорость зависит от версии рантайма, драйверов, длины контекста и настроек. Редакционные значения — ориентир, а не гарантированный результат.
$0.24 / $0.24 за 1M токенов





Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.