Weaver (alpha)
от Mancer
Other
Proprietary
CTX8K
PARНе раскрыто
StandardGeneralText
HumanEval 92.3%SWE-bench 61.2%GPQA 69.4%MMLU 86.1%
Для программирования сравнивайте не один общий рейтинг, а профиль модели: HumanEval и MBPP показывают решение коротких задач, SWE-bench — работу с реальными репозиториями, TerminalBench — действия в терминале. Для продакшена дополнительно учитывайте цену, контекст и поддержку инструментов. Телеграм-бот fLLMs мониторит бесплатные API-ключи в роутерах.
Значение показывается только там, где для модели есть результат конкретного теста · Методология и источники
Подборка моделей для генерации кода, работы с репозиториями, терминалом и автономной разработки.

