🚀 От чат-бота к AI-агенту: Evaluation & Observability

105 подписчиков

12+
12+

4 просмотра

9 часов назад

ПожаловатьсяНарушение авторских прав

105 подписчиков

12+
12+

4 просмотра

9 часов назад

ПожаловатьсяНарушение авторских прав
12+
12+

4 просмотра

9 часов назад

До сих пор мы строили систему: инструменты, MCP, память, Guardrails, несколько агентов. Однако это ещё не ответ на вопрос, насколько система надёжна. Один удачный прогон показывает возможность, но не вероятность. Один и тот же запрос проходит через Retrieval, несколько model calls, Tool вызовов, Guardrails — и два запуска одной задачи могут закончиться по-разному. ⚡️ Это шестая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова! Разберём Evaluation & Observability: как перейти от «работает в демо» к системе, качество которой можно воспроизводимо измерять и объяснять. В этом выпуске: — Почему классический тест input → expected output не работает для агентов — Eval как pipeline: Task Suite → Infrastructure → Criteria → Grading — Как выглядит валидный Task — pass@k и pass^k: capability и reliability — Graders: когда нужен code, когда LLM-as-a-Judge, когда человек — Observability: Session, Trace, Span — Production closes the loop: как превратить реальный failure в воспроизводимый Regression Task Подписывайтесь, чтобы не пропустить следующий выпуск! 🤖 AI-аналитик Artezio: https://artezio.ru/kentavr Телеграм-канал AI4Dev: https://t.me/LLM4dev #ai #machinelearningfullcourse #agents #llms #evaluations #observability

Название:

🚀 От чат-бота к AI-агенту: Evaluation & Observability