Claude Opus 5, единый mini‑SWE‑agent
Бенчмарки моделей для кода
Публичные результаты GPT‑5.6 Sol, Claude Opus 5, Claude Fable 5, Kimi K3 и Grok 4.5. Для каждого теста указаны условия запуска и уровень сопоставимости.
Обновлено 28 июля 2026 · результаты не сводятся в единый рейтинг.
GPT‑5.6 Sol: на 1 п.п. ниже, но дешевле
Grok 4.5 за попытку DeepSWE
Kimi K3 при средней цене $4.65
Модели и цены API
Цены указаны за 1 млн токенов и не учитывают кэширование, batch и длинный контекст.
DeepSWE v1.1
Все пять моделей запущены с mini‑SWE‑agent на одном наборе из 113 задач.
Полные метрики DeepSWE
Обновление независимого leaderboard: 25 июля 2026
| Модель | Score | Цена / попытку | Output tokens | Шаги | Расчёт $/успех |
|---|
Все опубликованные результаты
Пустая ячейка означает, что сопоставимый публичный результат не найден. Vendor-результаты не усредняются.
Опубликованные результаты
—
Краткие выводы
Не существует честного единого рейтинга: разные типы инженерной работы требуют разных сильных сторон.
Максимум качества
Claude Opus 5 лидирует в независимом DeepSWE и близок к Fable на repo-level задачах при вдвое меньшей API-цене.
DeepSWE · баланс продакшена
GPT‑5.6 Sol отстаёт от лидера DeepSWE всего на один пункт, но использует примерно вдвое меньше output-токенов.
DeepSWE · open-weight и автономность
Kimi K3 особенно интересен для самостоятельного хостинга и длинных agentic-сессий; на SWE Marathon он показывает сильный результат.
Цена и throughput
Grok 4.5 заметно уступает по DeepSWE score, зато завершает попытку с минимальными затратами и небольшим объёмом вывода.
Как собраны данные
Сайт сохраняет исходные опубликованные баллы и не строит непрозрачный «общий интеллект». У каждой строки есть уровень сопоставимости и источник.
Общий benchmark, harness и набор задач.
Одинаковое название benchmark, но возможны разные effort, agent scaffold или инфраструктура.
Vendor-таблицы, изменённые наборы или заметно разные условия.
Не делайте вывод по 0.5–1 п.п.
На небольших выборках доверительные интервалы часто перекрываются, а повторный запуск может изменить порядок соседних моделей.
Источники
Ссылки ведут на страницы разработчиков и независимые leaderboard.