Практический план оценки промпта до production: фиксированный dataset, relevance и groundedness, sample-level разбор, сравнение runs и human review без одной магической метрики.
Определите поведение до выбора метрики
Разделите тесты на обычные задачи, крайние случаи, отказ от неподдерживаемого запроса и работу с источниками. Для каждой строки запишите user intent, допустимый результат, недопустимый результат и требуемый контекст. Не загружайте реальные персональные диалоги без правового и privacy review; используйте обезличенные или синтетические примеры. Метрика выбирается после поведения: relevance подходит к ответу на запрос, groundedness — к опоре на переданный контекст, а safety evaluator — к отдельному классу риска.
Зафиксируйте основание сравнения
Microsoft Foundry принимает CSV или JSONL dataset и поддерживает built-in и custom evaluators. Сохраните dataset version, model deployment, system prompt, generation parameters и evaluator configuration. Baseline и candidate должны пройти один и тот же набор строк в одинаковых условиях. Если одновременно поменять модель, prompt и retrieval, улучшение нельзя отнести к одному фактору. Для небольшого набора aggregate score нестабилен, поэтому заранее задайте минимальное покрытие важных сценариев и ручную проверку критических строк.
Читайте aggregate вместе с провалами
В Foundry results доступны общие и sample-level метрики, а сравнение runs различает улучшение, деградацию и inconclusive результат. Сначала найдите строки ниже порога, затем сгруппируйте их по типу задачи. Высокая coherence не компенсирует низкую groundedness, если приложение обязано отвечать только по источникам. Не объявляйте победу по среднему баллу, если candidate ухудшил редкий, но критический сценарий. Любой LLM-as-judge результат дополняйте выборочным человеческим review.
Соберите регрессионный контур
После production запуска добавляйте в versioned dataset только обезличенные типовые сбои и явно помечайте источник примера. Microsoft описывает conversion traces в evaluation dataset и рекомендует фиксировать agent version, проверять фактическое число samples и выбирать репрезентативное окно. Stop condition для выпуска задайте заранее: например, ноль новых критических нарушений и отсутствие подтверждённой деградации ключевой метрики. Индексацию, продажи и удовлетворённость нельзя подменять внутренним evaluator score — это разные наблюдения.
Материал подготовлен редакцией VOne с применением ИИ для структурирования; факты вручную сверены с официальной документацией Microsoft, а форумная ветка использована только как обезличенный сигнал боли.
Источники и проверка
- Microsoft Learn — Run evaluations in Foundry проверено 2026-07-31
- Microsoft Learn — View Foundry evaluation results проверено 2026-07-31
- Microsoft Learn — Convert traces to evaluation datasets проверено 2026-07-31
Информация актуальна на дату публикации. Правила сервисов, приложений и сетей могут меняться.