After doing these courses, I feel confident creating professional visualizations and dashboards
Описание курса
Предварительные требования
Программа
Структура курса
Оценка LLM-приложений
Основы оценки
Вы научитесь проектировать комплексные системы оценки ИИ-приложений, измеряющие производительность по параметрам точности, стоимости и latency с использованием оценочных датасетов и различных типов оценщиков — от алгоритмического сопоставления до подходов LLM-as-judge. Это позволит вам заранее устанавливать критерии успеха и отслеживать прогресс в разработке приложений, готовых к релизу.
Реализация оценки
Вы научитесь на практике внедрять системы оценки, используя LangSmith для создания датасетов, определения оценщиков и выполнения экспериментов — создавая алгоритмические оценщики для объективного сравнения, LLM-as-judge для субъективной оценки и мультиметрические оценщики для комплексного анализа качества.
Оценка диалогов
Вы научитесь оценивать приложения на базе разговорного ИИ, используя онлайн-оценивание с оценкой на основе критериев — внедряя паттерны оценки на уровне отдельных реплик и всего диалога с помощью оценщиков LLM-as-judge — что позволит вам систематически измерять качество работы чат-бота по таким показателям, как связность, полнота выполнения задачи и эффективность.
LLM Application Evaluation with LangSmith
Курс
завершён

