Cognition SWE-2: ИИ-программист подешевел на 64% — это приговор или инструмент?

Cognition SWE-2: ИИ-программист подешевел на 64% — это приговор или инструмент?

Cognition выпустила SWE-2: ИИ-программист стал на 64% дешевле. Разбираем реальные бенчмарки, скрытые затраты и три сценария внедрения для бизнеса.
6 мин 15 Сен 2026 78

Тимлид открывает счёт за инференс и видит минус 64%. Cognition выпустила SWE-2 — модель, которая, по заявлению компании, работает почти как топовые конкуренты, но стоит на 64% меньше. Звучит как приговор для одних и подарок для других. Но давайте разберёмся, где здесь правда, а где маркетинг.

Мы не будем пересказывать пресс-релиз. Мы посмотрим, откуда взялись эти 64%, что скрывается за красивыми бенчмарками, и главное — что это значит для вас: для разработчика, для тимлида, для бизнеса.

Что реально выпустила Cognition: SWE-2 без маркетинговой шелухи

Видео: краткая демонстрация работы SWE-2 в интерфейсе Devin.

SWE-2 — это не отдельная API-модель, которую можно вызвать откуда угодно. Это кодинг-модель внутри Devin, продукта Cognition. Веса закрыты, отдельного прайс-листа за токены нет. Если хотите использовать SWE-2 — только через Devin Desktop, CLI или Fusion.

База модели — Kimi K3 от Moonshot AI, открытая модель с 2,8 трлн параметров. Cognition дообучила её с помощью reinforcement learning, и, по собственным заявлениям, это добавило 5–6 процентных пунктов на нескольких бенчмарках (DEV Community).

Здесь важно понимать: компания не тренировала модель с нуля. Она взяла сильную открытую базу и «докрутила» её. Это как тюнингованный двигатель от чужой машины — работает хорошо, но оригинальность конструкции вызывает вопросы.

Таблица бенчмарков: где SWE-2 выигрывает, а где проваливается

Cognition приводит четыре ключевых бенчмарка. Но не все они одинаково красноречивы.

Бенчмарк SWE-2 Claude Fable 5.1 GPT-6 Astra Комментарий
FrontierCode 1.1 Main 50,0% 50,9% 53,3% Отставание меньше 1 п.п., но это собственный бенчмарк Cognition
DeepSWE 1.1 73,0% 67,4% 74,1% Единственный бенчмарк, где SWE-2 реально обходит Fable 5.1
Terminal-Bench 2.1 92,8% 91,4% 89,9% Устаревшая версия бенчмарка, но именно её цитируют в заголовках
Terminal-Bench 4 27,3% 55,8% 57,9% Провал. Отставание почти в 2 раза на сложных длинных задачах

Инфографика: сравнение SWE-2 и конкурентов по ключевым бенчмаркам (FrontierCode 1.1, Terminal-Bench 4).

Обратите внимание на последнюю строку. Terminal-Bench 4 — это текущая, более сложная версия бенчмарка. И здесь SWE-2 показывает 27,3% против 55–58% у конкурентов. Это не «отставание на чуть-чуть». Это провал в два раза.

Почему так? Потому что SWE-2 — это Kimi K3 плюс пять. Где база сильна, модель сильна. Где база слаба — модель слаба. На длинных, сложных задачах Kimi K3 «сдувается», и SWE-2 вместе с ней.

И ещё важный момент: FrontierCode — это бенчмарк самой Cognition. Компания сама пишет задачи, сама ведёт таблицу лидеров, сама ставит оценки. Это не значит, что цифры врут. Это значит, что их нужно читать с поправкой на источник.

Откуда взялись 64%: разбор экономики по слоям

«64% дешевле» — это не цена за токен. Это средняя стоимость выполнения одной задачи внутри Devin на бенчмарке FrontierCode. Разберём, из чего складывается экономия.

Слой первый: прямая стоимость инференса. Cognition оптимизировала сервинг: NVFP4 и FP8-ядра, speculative decoding, prefill delayer. Это снижает затраты на каждый запрос.

Слой второй: эффективность взаимодействия. SWE-2 medium делает на 58% меньше ходов, чем SWE-1.7, и при этом показывает результат выше. Среднее количество шагов на задачу упало со 127 до 53. Первое реальное изменение кода происходит на 18-м шаге вместо 48-го.

Слой третий: архитектура Fusion. Devin Fusion использует «ведущую» модель для планирования и «дешёвую» (включая SWE-2) для исполнения. Это даёт экономию до 39% на бенчмарках при сохранении высокой производительности (Habr).

В российском контексте: предприниматель Никита Шуков заменил Senior-разработчика и помощника на ИИ-агента с оператором. Прямая экономия на ФОТ — более 5,4 млн рублей в год. Окупаемость — 3 месяца (РБК Компании).

По оценке McKinsey, автоматизация с помощью автономных ИИ-агентов экономит до $15–30 тыс. на одного разработчика в год (RB.RU).

Скрытые затраты: что не показывают в пресс-релизе

Экономия на инференсе — это только верхушка айсберга. Под водой — то, о чём молчат в маркетинговых материалах.

  • Закрытые веса и невозможность независимой проверки. Веса SWE-2 не опубликованы. Модель работает только внутри Devin. Вы не можете развернуть её на своей инфраструктуре, не можете прогнать собственные тесты, не можете сравнить с конкурентами в одинаковых условиях (Saipien).
  • Затраты на аудит кода. Код, сгенерированный ИИ, всё равно нужно проверять. Если модель ошибается на сложных задачах в два раза чаще, чем конкуренты, экономия на инференсе может съедаться ручным ревью и переработками.
  • Регрессии и технический долг. Код, который прошёл тесты сегодня, может сломаться через месяц. Чем сложнее задача, тем выше риск. А SWE-2 на сложных задачах — не лучший выбор.
  • Привязка к вендору. Нет API, нет альтернативных провайдеров. Если Cognition поднимет цены или изменит условия — у вас нет плана Б.
  • Ограниченный набор задач. Модель хорошо работает на средних задачах с чёткими критериями. На длинных, многошаговых проектах — провал.

Например, в кейсе Шукова, который мы упоминали, для управления агентом потребовался отдельный оператор — это дополнительная роль, которую пришлось создать. В enterprise-масштабе такие накладные расходы только растут.

Это не значит, что SWE-2 — плохой инструмент. Это значит, что «64% дешевле» — не вся правда. Реальная экономия зависит от того, какие задачи вы на неё ставите.

Три сценария внедрения: стартап, продуктовая команда, enterprise

Давайте посчитаем. Для каждого сценария — своя экономика и свои риски.

Сценарий Команда Потенциальная экономия Реальная экономия с учётом скрытых затрат Рекомендация
Стартап 10 разработчиков До $150–300 тыс./год (по McKinsey) 40–60% от потенциальной Подходит для рутинных задач. Не заменяет ключевых инженеров
Продуктовая команда 50 разработчиков До $750 тыс. – 1,5 млн/год 30–50% от потенциальной Требует пилотного проекта и метрик качества
Enterprise 500+ инженеров До $7,5–15 млн/год 20–40% от потенциальной Нужны governance, аудит и интеграция с CI/CD

В кейсе Шукова экономия на ФОТ составила 5,4 млн рублей в год при замене двух позиций. Но это была конкретная команда с конкретными задачами. В enterprise-масштабе экономия на одного разработчика будет ниже — из-за затрат на управление, безопасность и интеграцию.

Fusion-конфигурация с Astra + SWE-2 набирает 58,9 балла против 61,6 у Codex с Astra, но стоит на 39% меньше (Habr). Это показывает: экономия есть, но не всегда пропорциональна падению качества.

Что делать разработчику, чтобы не остаться за бортом

Я бы не бежал переучиваться на сантехника. Но и делать вид, что ничего не меняется, — глупо. Вот три конкретных действия на ближайшие 90 дней.

  1. Освойте управление ИИ-агентами. SWE-2, Devin, Fusion — это инструменты. Тот, кто умеет ставить задачи, проверять результат и управлять агентами, будет цениться выше, чем тот, кто пишет код вручную.
  2. Переходите в архитектуру и системный дизайн. ИИ хорошо делает рутину. Он плохо понимает контекст бизнеса, ограничения инфраструктуры и долгосрочные последствия решений. Это — ваша ниша.
  3. Развивайте навыки, которые ИИ не заменяет: коммуникация, переговоры, понимание продукта, работа с неопределённостью. Чем выше уровень абстракции, тем сложнее заменить человека.

Практические выводы и чек-лист для принятия решения

64% — это не вся правда. Но игнорировать это нельзя. SWE-2 меняет экономику ИИ-кодинга, но не отменяет ограничений.

Чек-лист для бизнеса:

  • Посчитайте TCO с учётом затрат на аудит, регрессии и управление.
  • Запустите пилот на простых задачах — там экономия максимальна.
  • Не заменяйте ключевых инженеров. Используйте ИИ для рутины.
  • Проверьте, готовы ли вы к привязке к одному вендору.
  • Дождитесь независимых бенчмарков, прежде чем масштабировать.

Чек-лист для разработчика:

  • Изучите SWE-2 в Devin — бесплатный доступ для подписчиков Pro, Max и Teams.
  • Попробуйте Fusion-конфигурацию — она даёт лучший баланс цены и качества.
  • Развивайте навыки, которые ИИ пока не заменяет.
  • Следите за независимыми оценками Terminal-Bench 4.
  • Не паникуйте. Паника — плохой советчик.

Подпишитесь на дайджест «Деньги не пахнут», чтобы не пропустить разборы следующих релизов — и не покупать хайп по цене инсайта.

Об авторе: Иван Петров — аналитик AI-редакции «Деньги не пахнут» с 10-летним опытом в разработке и управлении IT-продуктами. Специализируется на экономике технологий и практическом внедрении ИИ-решений.

Материал носит информационно-аналитический характер и не является рекомендацией по внедрению конкретных технологических решений.

Вердикт автора

Экономия 64% — это не отмена разработчиков, а перераспределение бюджета: меньше рутины, больше архитектуры. Проверьте, какие задачи можно отдать ИИ, и пересчитайте TCO с учётом аудита. Но не забывайте: ИИ не заменит того, кто умеет думать. Деньги не пахнут, но счёт за инференс пахнет отчётом, который придётся защищать перед CFO.


«Друзья, спасибо за то, что остаётесь со мной и читаете статьи! Каждый ваш отклик и поддержка — это стимул продолжать. Если обзоры и аналитика оказались полезными, угостите автора кофе—так мы вместе сохраняем независимость портала!»

☕️ Угостить кофе ☕️

Будьте впереди тренда

Первыми получайте обзоры, аналитику и интересные статьи портала.

Dev&AI

Комментарии (0)

Комментариев пока нет. Будьте первым!

Оставить комментарий