Тимлид открывает счёт за инференс и видит минус 64%. Cognition выпустила SWE-2 — модель, которая, по заявлению компании, работает почти как топовые конкуренты, но стоит на 64% меньше. Звучит как приговор для одних и подарок для других. Но давайте разберёмся, где здесь правда, а где маркетинг.
Мы не будем пересказывать пресс-релиз. Мы посмотрим, откуда взялись эти 64%, что скрывается за красивыми бенчмарками, и главное — что это значит для вас: для разработчика, для тимлида, для бизнеса.
Что реально выпустила Cognition: SWE-2 без маркетинговой шелухи
Видео: краткая демонстрация работы SWE-2 в интерфейсе Devin.
SWE-2 — это не отдельная API-модель, которую можно вызвать откуда угодно. Это кодинг-модель внутри Devin, продукта Cognition. Веса закрыты, отдельного прайс-листа за токены нет. Если хотите использовать SWE-2 — только через Devin Desktop, CLI или Fusion.
База модели — Kimi K3 от Moonshot AI, открытая модель с 2,8 трлн параметров. Cognition дообучила её с помощью reinforcement learning, и, по собственным заявлениям, это добавило 5–6 процентных пунктов на нескольких бенчмарках (DEV Community).
Здесь важно понимать: компания не тренировала модель с нуля. Она взяла сильную открытую базу и «докрутила» её. Это как тюнингованный двигатель от чужой машины — работает хорошо, но оригинальность конструкции вызывает вопросы.
Таблица бенчмарков: где SWE-2 выигрывает, а где проваливается
Cognition приводит четыре ключевых бенчмарка. Но не все они одинаково красноречивы.
| Бенчмарк | SWE-2 | Claude Fable 5.1 | GPT-6 Astra | Комментарий |
|---|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 50,9% | 53,3% | Отставание меньше 1 п.п., но это собственный бенчмарк Cognition |
| DeepSWE 1.1 | 73,0% | 67,4% | 74,1% | Единственный бенчмарк, где SWE-2 реально обходит Fable 5.1 |
| Terminal-Bench 2.1 | 92,8% | 91,4% | 89,9% | Устаревшая версия бенчмарка, но именно её цитируют в заголовках |
| Terminal-Bench 4 | 27,3% | 55,8% | 57,9% | Провал. Отставание почти в 2 раза на сложных длинных задачах |
Инфографика: сравнение SWE-2 и конкурентов по ключевым бенчмаркам (FrontierCode 1.1, Terminal-Bench 4).
Обратите внимание на последнюю строку. Terminal-Bench 4 — это текущая, более сложная версия бенчмарка. И здесь SWE-2 показывает 27,3% против 55–58% у конкурентов. Это не «отставание на чуть-чуть». Это провал в два раза.
Почему так? Потому что SWE-2 — это Kimi K3 плюс пять. Где база сильна, модель сильна. Где база слаба — модель слаба. На длинных, сложных задачах Kimi K3 «сдувается», и SWE-2 вместе с ней.
И ещё важный момент: FrontierCode — это бенчмарк самой Cognition. Компания сама пишет задачи, сама ведёт таблицу лидеров, сама ставит оценки. Это не значит, что цифры врут. Это значит, что их нужно читать с поправкой на источник.
Откуда взялись 64%: разбор экономики по слоям
«64% дешевле» — это не цена за токен. Это средняя стоимость выполнения одной задачи внутри Devin на бенчмарке FrontierCode. Разберём, из чего складывается экономия.
Слой первый: прямая стоимость инференса. Cognition оптимизировала сервинг: NVFP4 и FP8-ядра, speculative decoding, prefill delayer. Это снижает затраты на каждый запрос.
Слой второй: эффективность взаимодействия. SWE-2 medium делает на 58% меньше ходов, чем SWE-1.7, и при этом показывает результат выше. Среднее количество шагов на задачу упало со 127 до 53. Первое реальное изменение кода происходит на 18-м шаге вместо 48-го.
Слой третий: архитектура Fusion. Devin Fusion использует «ведущую» модель для планирования и «дешёвую» (включая SWE-2) для исполнения. Это даёт экономию до 39% на бенчмарках при сохранении высокой производительности (Habr).
В российском контексте: предприниматель Никита Шуков заменил Senior-разработчика и помощника на ИИ-агента с оператором. Прямая экономия на ФОТ — более 5,4 млн рублей в год. Окупаемость — 3 месяца (РБК Компании).
По оценке McKinsey, автоматизация с помощью автономных ИИ-агентов экономит до $15–30 тыс. на одного разработчика в год (RB.RU).
Скрытые затраты: что не показывают в пресс-релизе
Экономия на инференсе — это только верхушка айсберга. Под водой — то, о чём молчат в маркетинговых материалах.
- Закрытые веса и невозможность независимой проверки. Веса SWE-2 не опубликованы. Модель работает только внутри Devin. Вы не можете развернуть её на своей инфраструктуре, не можете прогнать собственные тесты, не можете сравнить с конкурентами в одинаковых условиях (Saipien).
- Затраты на аудит кода. Код, сгенерированный ИИ, всё равно нужно проверять. Если модель ошибается на сложных задачах в два раза чаще, чем конкуренты, экономия на инференсе может съедаться ручным ревью и переработками.
- Регрессии и технический долг. Код, который прошёл тесты сегодня, может сломаться через месяц. Чем сложнее задача, тем выше риск. А SWE-2 на сложных задачах — не лучший выбор.
- Привязка к вендору. Нет API, нет альтернативных провайдеров. Если Cognition поднимет цены или изменит условия — у вас нет плана Б.
- Ограниченный набор задач. Модель хорошо работает на средних задачах с чёткими критериями. На длинных, многошаговых проектах — провал.
Например, в кейсе Шукова, который мы упоминали, для управления агентом потребовался отдельный оператор — это дополнительная роль, которую пришлось создать. В enterprise-масштабе такие накладные расходы только растут.
Это не значит, что SWE-2 — плохой инструмент. Это значит, что «64% дешевле» — не вся правда. Реальная экономия зависит от того, какие задачи вы на неё ставите.
Три сценария внедрения: стартап, продуктовая команда, enterprise
Давайте посчитаем. Для каждого сценария — своя экономика и свои риски.
| Сценарий | Команда | Потенциальная экономия | Реальная экономия с учётом скрытых затрат | Рекомендация |
|---|---|---|---|---|
| Стартап | 10 разработчиков | До $150–300 тыс./год (по McKinsey) | 40–60% от потенциальной | Подходит для рутинных задач. Не заменяет ключевых инженеров |
| Продуктовая команда | 50 разработчиков | До $750 тыс. – 1,5 млн/год | 30–50% от потенциальной | Требует пилотного проекта и метрик качества |
| Enterprise | 500+ инженеров | До $7,5–15 млн/год | 20–40% от потенциальной | Нужны governance, аудит и интеграция с CI/CD |
В кейсе Шукова экономия на ФОТ составила 5,4 млн рублей в год при замене двух позиций. Но это была конкретная команда с конкретными задачами. В enterprise-масштабе экономия на одного разработчика будет ниже — из-за затрат на управление, безопасность и интеграцию.
Fusion-конфигурация с Astra + SWE-2 набирает 58,9 балла против 61,6 у Codex с Astra, но стоит на 39% меньше (Habr). Это показывает: экономия есть, но не всегда пропорциональна падению качества.
Что делать разработчику, чтобы не остаться за бортом
Я бы не бежал переучиваться на сантехника. Но и делать вид, что ничего не меняется, — глупо. Вот три конкретных действия на ближайшие 90 дней.
- Освойте управление ИИ-агентами. SWE-2, Devin, Fusion — это инструменты. Тот, кто умеет ставить задачи, проверять результат и управлять агентами, будет цениться выше, чем тот, кто пишет код вручную.
- Переходите в архитектуру и системный дизайн. ИИ хорошо делает рутину. Он плохо понимает контекст бизнеса, ограничения инфраструктуры и долгосрочные последствия решений. Это — ваша ниша.
- Развивайте навыки, которые ИИ не заменяет: коммуникация, переговоры, понимание продукта, работа с неопределённостью. Чем выше уровень абстракции, тем сложнее заменить человека.
Практические выводы и чек-лист для принятия решения
64% — это не вся правда. Но игнорировать это нельзя. SWE-2 меняет экономику ИИ-кодинга, но не отменяет ограничений.
Чек-лист для бизнеса:
- Посчитайте TCO с учётом затрат на аудит, регрессии и управление.
- Запустите пилот на простых задачах — там экономия максимальна.
- Не заменяйте ключевых инженеров. Используйте ИИ для рутины.
- Проверьте, готовы ли вы к привязке к одному вендору.
- Дождитесь независимых бенчмарков, прежде чем масштабировать.
Чек-лист для разработчика:
- Изучите SWE-2 в Devin — бесплатный доступ для подписчиков Pro, Max и Teams.
- Попробуйте Fusion-конфигурацию — она даёт лучший баланс цены и качества.
- Развивайте навыки, которые ИИ пока не заменяет.
- Следите за независимыми оценками Terminal-Bench 4.
- Не паникуйте. Паника — плохой советчик.
Подпишитесь на дайджест «Деньги не пахнут», чтобы не пропустить разборы следующих релизов — и не покупать хайп по цене инсайта.
Об авторе: Иван Петров — аналитик AI-редакции «Деньги не пахнут» с 10-летним опытом в разработке и управлении IT-продуктами. Специализируется на экономике технологий и практическом внедрении ИИ-решений.
Материал носит информационно-аналитический характер и не является рекомендацией по внедрению конкретных технологических решений.
Вердикт автора
Экономия 64% — это не отмена разработчиков, а перераспределение бюджета: меньше рутины, больше архитектуры. Проверьте, какие задачи можно отдать ИИ, и пересчитайте TCO с учётом аудита. Но не забывайте: ИИ не заменит того, кто умеет думать. Деньги не пахнут, но счёт за инференс пахнет отчётом, который придётся защищать перед CFO.
Комментарии (0)
Комментариев пока нет. Будьте первым!