К обсуждениям

Один evaluation dataset для нескольких prompt-проектов: версия и baseline

Редакция VOne Технологии

Как разделить неизменяемые тестовые примеры, проектные варианты prompt и результаты Microsoft Foundry, чтобы сравнение не меняло вопрос вместе с ответом.

Разделите четыре изменяемых объекта

У теста есть набор примеров, вариант prompt или agent, конфигурация evaluator и конкретный run. Дайте каждому собственный идентификатор. Dataset version меняется, когда добавлена строка, исправлен input, ground truth или допустимый ответ. Prompt variant меняется при редактировании инструкции, модели или существенных параметров. Evaluator configuration фиксирует критерии и пороги. Run связывает три предыдущих объекта со временем и результатом. Такая схема позволяет сравнить несколько проектов на одном baseline и увидеть, что изменился именно кандидат, а не тест. Название файла само по себе этого не гарантирует.

Зафиксируйте схему и происхождение строк

Microsoft Foundry принимает существующие данные в JSONL, а для turn-level сценариев также CSV; conversation-level входы представлены массивом messages в JSONL. До загрузки опишите обязательные поля, допустимые пустые значения и уровень строки. Для каждого примера храните нейтральный case ID, категорию, input и при необходимости ground truth или context. Не включайте реальные персональные запросы без правового и внутреннего основания: обезличьте их или создайте синтетический аналог, сохранив диагностическое свойство. Сумма хешей нормализованных строк и краткий changelog помогут доказать, что два запуска видели один baseline.

Переиспользуйте версию, не копию

Загрузите проверенный набор как версионированный dataset проекта и передавайте одну и ту же версию в запуски сравниваемых prompt-проектов. Документация Foundry показывает, что cloud evaluations хранят результаты в проекте и могут работать с существующим dataset; документация optimizer отдельно допускает Foundry dataset с именем и версией либо локальный JSONL. Копия нужна только при намеренном ответвлении эксперимента. Если два файла имеют одинаковые строки, но разные неотслеживаемые правки, аудит сравнения усложняется. Ссылка на один version ID делает baseline явным.

Вводите новую версию по правилу изменения смысла

Исправление опечатки, которое меняет интерпретацию input, новая категория, смена ground truth или удаление проблемной строки требуют новой версии и записи причины. Новый prompt, модель или evaluator не требуют переписывать dataset: их идентификаторы должны меняться отдельно. Перед сравнением сформируйте таблицу run ID, dataset name/version, hash, prompt variant, model deployment и evaluator version. Остановите вывод, если хотя бы одна из этих ячеек неизвестна. В отчёте публикуйте агрегаты и обезличенные примеры; не раскрывайте секреты проекта, endpoint, ключи, внутренние prompt или пользовательские данные.

Материал подготовлен редакцией VOne с применением ИИ для структурирования; возможности Foundry datasets и cloud evaluation вручную сверены с Microsoft Learn, а вопрос использован только как обезличенный сигнал.

Источники и проверка

Информация актуальна на дату публикации. Правила сервисов, приложений и сетей могут меняться.

Ответы

0 опубликовано
Ответов пока нет. Вы можете начать обсуждение.

Ваш ответ

Добавьте свой опыт или уточнение по теме.

Вы публикуете как Аноним Аватар отличает разговоры, но не раскрывает личные данные.

Ответ появится сразу. Не публикуйте личные данные, ключи и приватные ссылки.