Текущая2024-09-25

От Meta
Llama 3.2 11B Vision — мультимодальная модель с 11 миллиардами параметров, предназначенная для решения задач, объединяющих визуальные и текстовые данные. Он превосходно справляется с такими задачами, как создание подписей к изображениям и...
Llama 3.2 11B Vision Instruct сильнее всего выглядит в категории «общее качество». Профиль рассчитан по процентилям LiveBench, Artificial Analysis и LMArena; пропуски не считаются нулём.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
средняя
Покрытие
2 теста · 2 направления
Происхождение
artificialAnalysis + lmarenaVision
1 тест · уверенность: средняя
1 тест · уверенность: средняя
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| GPQA (Экспертные знания) | 63.4% | н/д | Источник не указан |
| MATH (Математика) | 87.9% | н/д | Источник не указан |
| MMLU (Общие знания) | 86.3% | н/д | Источник не указан |
| Arena Elo (LMSYS) | 1416 | н/д | Источник не указан |
| HumanEval (Кодинг) | 88.2% | н/д | Источник не указан |
| SWE-bench (Разработка) | 61.8% | н/д | Источник не указан |
Llama 3.2 11B Vision Instruct — это высокопроизводительная мультимодальная языковая модель от компании Meta, представленная в сентябре 2024 года. С 11 миллиардами параметров, эта модель специально разработана для решения задач, требующих одновременного понимания визуальной и текстовой информации. Llama 3.2 11B является идеальным «мозгом» для интерактивных ассистентов, способных «видеть» и анализировать окружающий мир, предлагая возможности флагманского уровня при высокой скорости работы.
Модель построена на базе обновленной архитектуры Llama 3.2, включающей нативные слои обработки визуальных данных.
Llama 3.2 11B Vision Instruct устанавливает новые стандарты для открытых мультимодальных моделей среднего размера, показывая выдающиеся результаты в тестах на общие знания и логику.
| Бенчмарк | Результат | Описание |
|---|---|---|
| Arena Elo | 1416 | Топ-уровень для 11B мультимодальных моделей |
| HumanEval | 88.2% | Высокое качество генерации программного кода |
| MATH | 87.9% | Сильные способности в математике и логике |
| MMLU | 86.3% | Глубокие общие знания и эрудиция |
| GPQA | 63.4% | Научные тесты PhD-уровня |
| SWE_bench | 61.8% | Решение инженерных задач в реальных условиях |
Модель доступна в виде открытых весов (Open-Source) и через API популярных агрегаторов по крайне привлекательной цене: всего $0.24 за 1M токенов (как на вход, так и на выход). Это делает Llama 3.2 11B одним из самых экономически эффективных решений для масштабных мультимодальных приложений.
Плюсы:
Минусы:
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Реальные замеры сообщества и помеченные редакционные ориентиры для локального запуска Llama 3.2 11B Vision Instruct.
Сначала оцените, поместится ли выбранная квантизация в вашу RAM или VRAM.
Калькулятор локальных LLMДля этой модели пока нет одобренных замеров.
Если вы запускали её локально, поделитесь конфигурацией — после проверки она появится здесь.
Скорость зависит от версии рантайма, драйверов, длины контекста и настроек. Редакционные значения — ориентир, а не гарантированный результат.
История семейства
Последовательность собрана по датам релиза моделей Meta в каталоге. Она показывает соседние поколения, но не приписывает им совместимость или наследование архитектуры без отдельного источника.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.