От Alpindale
Большой LLM, созданный путем объединения двух точно настроенных моделей Llama 70B в одну модель 120B. Объединяет Xwin и Euryale. Благодарность - [@chargoddard](https://huggingface.co/chargoddard) за разработку структуры, используемой для слияния...
Для Goliath 120B пока нет совпавших результатов в подключённых публичных лидербордах. Исходные значения карточки не используются для G‑Score.
Показатели G‑Код, G‑Рассуждения, G‑Агенты и G‑Зрение рассчитаны по массовым таблицам LiveBench, Artificial Analysis и LMArena. Наведите или нажмите на значок рядом с оценкой, чтобы увидеть исходный лидерборд, вариант модели, значение и размер выборки.
Уверенность данных
низкая
Покрытие
0 тестов · 0 направлений
Происхождение
нет данных лидербордов
Место исходного бенчмарка показывается только при закреплённом source record и среди других карточек с источником. Эти старые значения не участвуют в G-Score лидербордов.
| Бенчмарк | Результат | Место | Доказательство |
|---|---|---|---|
| GPQA (Экспертные знания) | 63.8% | н/д | Источник не указан |
| MATH (Математика) | 78.6% | н/д | Источник не указан |
| MMLU (Общие знания) | 86.4% | н/д | Источник не указан |
| Arena Elo (LMSYS) | 1417 | н/д | Источник не указан |
| HumanEval (Кодинг) | 82.9% | н/д | Источник не указан |
| SWE-bench (Разработка) | 46% | н/д | Источник не указан |
Goliath 120B — это высокопроизводительная языковая модель, представляющая собой результат сложного слияния (merge) двух профессионально дообученных версий Llama 70B. Созданная разработчиком Alpindale с использованием инновационного фреймворка для мерджа моделей, Goliath 120B стала легендарной в сообществе благодаря своей исключительной глубине рассуждений, богатому литературному стилю и «человечности» ответов, недоступной многим базовым моделям аналогичного размера.
Модель Goliath 120B была создана путем объединения весов моделей Xwin 70B и Euryale 70B, каждая из которых была лучшей в своём сегменте (логика и творчество соответственно).
Goliath 120B демонстрирует стабильно высокие результаты в тестах на общие знания и творческое письмо, становясь эталоном для моделей на базе мерджа.
| Бенчмарк | Результат | Описание |
|---|---|---|
| Arena Elo | 1417 | Высокий профессиональный уровень |
| MMLU | 86.4% | Глубокие общие знания и эрудиция |
| HumanEval | 82.9% | Хорошее качество генерации программного кода |
| GPQA | 63.8% | Научные вопросы PhD-уровня |
| MATH | 78.6% | Хорошие способности в математике и логике |
| SWE_bench | 46.0% | Решение инженерных задач |
Модель доступна через API популярных агрегаторов (например, OpenRouter) по цене $3.75 за 1M входных токенов и $7.50 за 1M выходных токенов. Это премиальное решение для тех, кто ищет бескомпромиссное качество текста и глубину «личности» ИИ для специфических творческих и аналитических задач.
Плюсы:
Минусы:
Цены приведены за 1 млн токенов и могут меняться. Доступность российских провайдеров проверяется на их стороне.
Сервисы, инструменты, материалы и обсуждения, связанные с моделью.
Откройте результаты по названию модели и проверьте актуальную интеграцию.
Точных связей пока нет. Искать по разработчику.
Задайте вопрос сообществу — карточка модели будет прикреплена автоматически.