Оценка промптов: как понять, что промпт стал лучше

Перевод официального курса Anthropic Prompt Evaluations. Обычно промпты правят на глаз: поменял формулировку, посмотрел один ответ, вроде лучше. Эвалы — это способ перестать гадать: набор тестовых случаев, автоматический оценщик и число, которое можно сравнить до и после. Тот самый шаг, который отделяет демку от продукта.

Самый практический курс линейки. Нужен Python; со второй половины подключается promptfoo — внешний инструмент для эвалов по конфигу. Базовый промптинг считается знакомым.
Ещё не начато
  1. 1 Зачем нужны эвалы и из чего они состоят готово
  2. 2 Эвалы в Workbench без единой строчки кода готово
  3. 3 Проверка кодом: пишем свой грейдер готово
  4. 4 Оценка классификации готово
  5. 5 promptfoo: эвалы по конфигу готово
  6. 6 promptfoo на задаче классификации готово
  7. 7 Свои грейдеры в promptfoo готово
  8. 8 Когда оценивает модель готово
  9. 9 Свой оценщик-модель со своими критериями готово
Курс переведён целиком — все 9 уроков открыты. Что перевожу дальше — рассказываю в канале @aishipuchka.
Оригинал: Prompt Evaluations © Anthropic, лицензия CC BY-NC 4.0. Перевод и адаптация: Дарья Воронкина (@aishipuchka). Материалы изменены: переведены на русский, примеры и названия моделей актуализированы. Используется некоммерчески.