Оценки и модульные тесты — не одно и то же
Видео "Evals Are Not Unit Tests — Ido Pesok, Vercel v0" объясняет важность оценок (evals) для приложений с использованием больших языковых моделей (LLM), акцентируя внимание на их непредсказуемости на примере простого счётчика букв во фруктах. Автор утверждает, что традиционные методы тестирования недостаточны для LLM, и предлагает новый подход к созданию надёжного ПО, который включает построение "игровой площадки" (court) из пользовательских запросов, сбор данных о производительности LLM и автоматизацию оценки с использованием CI/CD. Он подчёркивает необходимость понимания поведения пользователей и сосредоточения на актуальных проблемах, а также использование постоянных значений в данных и переменных в задачах для эффективного тестирования. В конечном итоге, цель оценок — систематически улучшать приложение, повышая его надёжность и качество.
Название:
Оценки и модульные тесты — не одно и то же
Категория:
Разное