Назад
9 июля 2026 г. в 06:11 AI Coding Cognition Devin Coding Agents Kimi Benchmarks Cognition / Techmeme

Devin получил новую модель для кода: Cognition обещает уровень лидеров рынка дешевле конкурентов

Devin получил новую модель для кода: Cognition обещает уровень лидеров рынка дешевле конкурентов

Devin получил новую модель для кода: Cognition обещает уровень лидеров рынка дешевле конкурентов

Cognition выпустила SWE-1.7 — новую модель для агентного программирования в Devin. По заявлению компании, она приближается к уровню передовых моделей при меньшей стоимости и уже доступна в Devin Web, Desktop и CLI через Cerebras со скоростью до 1000 токенов в секунду.

Важная деталь: SWE-1.7 обучали не с нуля, а на базе Kimi K2.7 Code. Cognition пишет, что дополнительное RL-обучение дало крупный прирост и ставит под сомнение идею «потолка» посттренинга: даже уже дообученную сильную модель можно заметно сдвинуть, если тренировать её под конкретный рабочий процесс.

Почему это важно для AI-кодинга

Компания сравнивает SWE-1.7 с GPT-5.5, Opus 4.8 и другими моделями на агентных кодовых бенчмарках. Эти цифры стоит читать осторожно: часть тестов внутренняя, а рынок уже видел споры о качестве SWE-бенчмарков. Но сама заявка показательна. Cognition продаёт не универсальный чатбот, а модель, заточенную под длинные задачи в реальной кодовой базе.

В блоге компания отдельно подчёркивает поведение SWE-1.7: модель чаще исследует файлы, вызывает инструменты, ищет граничные случаи и экспериментирует небольшими скриптами, прежде чем менять код. Это ровно та область, где coding-агенты отличаются от автодополнения: они должны не написать красивый фрагмент, а разобраться, почему система сломалась.

Рынок уходит от одного чемпиона

Для разработчиков и компаний практический смысл простой: AI-кодинг становится рынком специализированных исполнителей. Microsoft продвигает собственные MAI-модели для офисных и кодовых сценариев, Anthropic спорит за доверие к Claude Code, китайские модели давят ценой, а Cognition теперь показывает связку Devin + SWE-1.7 как более дешёвый путь к сложным задачам.

Следующий вопрос — не только «кто набрал больше процентов на бенчмарке». Важнее, сколько стоит закрытая задача, как агент проверяет себя, не раздувает ли изменение и можно ли доверить ему длинный цикл без постоянного присмотра. SWE-1.7 делает эту конкуренцию более предметной: сильная coding-модель всё чаще будет частью продукта и процесса, а не отдельной строкой в таблице рейтингов.

Ещё новости

Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле
7 октября 2026 г.
Anthropic выпустила Claude Haiku 5.5: массовые ИИ-агенты стали дешевле

Anthropic представила Claude Haiku 5.5 — малую модель для быстрых и недорогих задач: от классификации и суммаризации до субагентов и работы в браузере. Для запросов до 100 тысяч токенов вход и выход стали в десять раз дешевле, чем у Haiku 4.5.

Google запустил Playground: игры по текстовому запросу
7 октября 2026 г.
Google запустил Playground: игры по текстовому запросу

Google открыл экспериментальную платформу Playground: пользователь описывает игру текстом, тестирует её в браузере и делится ссылкой. На старте сервис доступен совершеннолетним пользователям из США, а возможности создания зависят от подписки Google One.

OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены
7 октября 2026 г.
OpenAI выложила 722 математические рукописи — но не все доказательства уже проверены

OpenAI открыла каталог результатов внутренней модели: 722 рукописи в 372 связанных семействах. Компания подчёркивает, что материалы находятся на разных стадиях проверки, а часть результатов без формализации в Lean может содержать ошибки.

Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой
7 октября 2026 г.
Georgia Tech готовит онлайн-магистратуру по ИИ с обязательной практикой

Georgia Tech получила одобрение на новую онлайн-магистратуру по искусственному интеллекту. Старт намечен на 2027 год: программа обещает шесть направлений и обязательный проект с компанией или организацией, но детали приёма и стоимости пока не раскрыты.

Mistral Large 4: API уже доступен, веса — в конце октября
6 октября 2026 г.
Mistral Large 4: API уже доступен, веса — в конце октября

Mistral открыла public preview Mistral Large 4 — мультимодальной модели с 1 трлн параметров, из которых активно 49 млрд. В API её уже можно попробовать, но обещанные open weights появятся лишь в конце октября.

Reflection показала Beam на 501 млрд параметров — но веса выйдут позже
6 октября 2026 г.
Reflection показала Beam на 501 млрд параметров — но веса выйдут позже

Reflection представила Beam — открытую по весам MoE-модель для кода, рассуждений и агентов. Пока это ранний доступ: веса, model card и технический отчёт обещаны лишь позднее в октябре.

OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС
6 октября 2026 г.
OpenAI начнёт маркировать тексты ChatGPT и Codex в ЕС

OpenAI сообщила, что будет добавлять невидимую маркировку в тексты ChatGPT и Codex для пользователей из ЕС. Метка должна помочь выполнять требования AI Act, но компания признаёт: после существенной правки текста её будет труднее обнаружить.

GitHub открыла API для запуска проверок кода Copilot
5 октября 2026 г.
GitHub открыла API для запуска проверок кода Copilot

GitHub разрешила запускать проверку pull request’ов Copilot через REST и GraphQL API. Одновременно для новых и уже существующих репозиториев стандартным уровнем тщательности стал Balanced.

AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком
5 октября 2026 г.
AWS показала Well-Architected Agent: ИИ-ревизор для облака, но с правами и проверкой человеком

AWS открыла предварительный доступ к Well-Architected Agent — сервису, который анализирует инфраструктуру и предлагает исправления для стоимости, производительности, устойчивости и безопасности. Рекомендации могут включать изменения IaC, но AWS отдельно предупреждает: генеративный ИИ способен ошибаться.

Google урезает доступ к Gemini: бесплатным оставят Flash-Lite
4 октября 2026 г.
Google урезает доступ к Gemini: бесплатным оставят Flash-Lite

Google меняет набор моделей Gemini для бесплатных пользователей и подписки AI Plus. С 9 октября доступ к Pro исчезнет у обоих уровней, а платный AI Pro получит Deep Think.

Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной
4 октября 2026 г.
Руководитель по безопасности OpenAI ушёл, назвав культуру компании сломанной

Дэвид Робинсон, руководивший подготовкой отчётов по безопасности к релизам OpenAI, покинул компанию. В эссе он заявил, что темп запусков не оставляет ей достаточной осторожности; OpenAI ответила, что продолжает усиливать практики безопасности и при необходимости замедляет обучение или выпуск моделей.

PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ
4 октября 2026 г.
PFNYC: в Нью-Йорке сжимаются стартовые вакансии в профессиях, уязвимых для ИИ

В Нью-Йорке с 2022 года заметно сократилось число стартовых вакансий в нескольких офисных профессиях с высокой подверженностью ИИ, сообщает Partnership for New York City. Данные PFNYC и отдельная работа Stanford фиксируют совпадающие ранние паттерны, но не доказывают, что их причиной стал именно ИИ.