Доклад

LangFuse для LLM-агентов: как съесть кактус тестирования, не уколовшись

  • AI

Качество любого LLM-решения определяется только метриками. В случае с автономными мультиагентными системами определить, какие модели и настройки использовать, какие промпты подходят и где агент ошибается, можно только посредством экспериментов. Но как сделать эти эксперименты информативными, распараллеливаемыми и прозрачными для всей команды?

В докладе на боевых примерах разберем, почему тестирование мультиагентных систем оказывается сложной инженерной задачей: как работать с недетерминированным качеством, создавать датасеты, выбирать целевые метрики, модели и их параметры, а также разбираться в логах агентов и субагентов. Постепенно разберем решения этих проблем и придем к LangFuse — инструменту, который позволяет превратить эксперименты с агентами в понятный инженерный процесс.

Покажем, как с помощью LangFuse параллельно тестировать и размечать датасеты, анализировать работу агентов, выбирать подходящие модели, разделять мультиагентную систему на E2E- и изолированные тесты для субагентов, версионировать промпты и деплоить их в прод по тегу. А главное — как оставлять цифровые следы каждого прогона на дашборде метрик и видеть, растёт качество системы или падает.

В финале немного заглянем в будущее и поговорим о Harness и новых проблемах, которые он приносит в тестирование автономных систем, а также о том, как LangFuse может помочь с ними справляться.

Спикеры

Доклады