Публичный срез · июль 2026

Бенчмарки моделей для кода

Публичные результаты GPT‑5.6 Sol, Claude Opus 5, Claude Fable 5, Kimi K3 и Grok 4.5. Для каждого теста указаны условия запуска и уровень сопоставимости.

Обновлено 28 июля 2026 · результаты не сводятся в единый рейтинг.

DeepSWE · лучший score 74%

Claude Opus 5, единый mini‑SWE‑agent

DeepSWE · баланс 73% / $8.39

GPT‑5.6 Sol: на 1 п.п. ниже, но дешевле

DeepSWE · минимальная цена $2.42

Grok 4.5 за попытку DeepSWE

DeepSWE · open-weight 69%

Kimi K3 при средней цене $4.65

Модели

Модели и цены API

Цены указаны за 1 млн токенов и не учитывают кэширование, batch и длинный контекст.

Единый agent harness

DeepSWE v1.1

Все пять моделей запущены с mini‑SWE‑agent на одном наборе из 113 задач.

Выше — лучше · 113 задач
Один benchmark, общий агент $/успех — расчётная стоимость: цена попытки ÷ вероятность решения

Полные метрики DeepSWE

Обновление независимого leaderboard: 25 июля 2026

Открыть источник ↗
Модель Score Цена / попытку Output tokens Шаги Расчёт $/успех
Сводная таблица

Все опубликованные результаты

Пустая ячейка означает, что сопоставимый публичный результат не найден. Vendor-результаты не усредняются.

Опубликованные результаты

Интерпретация

Краткие выводы

Не существует честного единого рейтинга: разные типы инженерной работы требуют разных сильных сторон.

01

Максимум качества

Claude Opus 5 лидирует в независимом DeepSWE и близок к Fable на repo-level задачах при вдвое меньшей API-цене.

02

DeepSWE · баланс продакшена

GPT‑5.6 Sol отстаёт от лидера DeepSWE всего на один пункт, но использует примерно вдвое меньше output-токенов.

03

DeepSWE · open-weight и автономность

Kimi K3 особенно интересен для самостоятельного хостинга и длинных agentic-сессий; на SWE Marathon он показывает сильный результат.

04

Цена и throughput

Grok 4.5 заметно уступает по DeepSWE score, зато завершает попытку с минимальными затратами и небольшим объёмом вывода.

Условия сравнения

Как собраны данные

Сайт сохраняет исходные опубликованные баллы и не строит непрозрачный «общий интеллект». У каждой строки есть уровень сопоставимости и источник.

Высокая

Общий benchmark, harness и набор задач.

Средняя

Одинаковое название benchmark, но возможны разные effort, agent scaffold или инфраструктура.

Ограниченная

Vendor-таблицы, изменённые наборы или заметно разные условия.

Не делайте вывод по 0.5–1 п.п.

На небольших выборках доверительные интервалы часто перекрываются, а повторный запуск может изменить порядок соседних моделей.

Ссылки

Источники

Ссылки ведут на страницы разработчиков и независимые leaderboard.