Артем Самойлов
Сбер
Качество любого LLM-решения определяется только метриками. В случае с автономными мультиагентными системами определить, какие модели и настройки использовать, какие промпты подходят и где агент ошибается, можно только посредством экспериментов. Но как сделать эти эксперименты информативными, распараллеливаемыми и прозрачными для всей команды?
В докладе на боевых примерах разберем, почему тестирование мультиагентных систем оказывается сложной инженерной задачей: как работать с недетерминированным качеством, создавать датасеты, выбирать целевые метрики, модели и их параметры, а также разбираться в логах агентов и субагентов. Постепенно разберем решения этих проблем и придем к LangFuse — инструменту, который позволяет превратить эксперименты с агентами в понятный инженерный процесс.
Покажем, как с помощью LangFuse параллельно тестировать и размечать датасеты, анализировать работу агентов, выбирать подходящие модели, разделять мультиагентную систему на E2E- и изолированные тесты для субагентов, версионировать промпты и деплоить их в прод по тегу. А главное — как оставлять цифровые следы каждого прогона на дашборде метрик и видеть, растёт качество системы или падает.
В финале немного заглянем в будущее и поговорим о Harness и новых проблемах, которые он приносит в тестирование автономных систем, а также о том, как LangFuse может помочь с ними справляться.
Сбер