
A practical guide and toolkit for evaluating AI outputs, diagnosing recurring failures, testing controlled improvements and making evidence-based release decisions. Includes the 27-page guide, evaluation scorecard, prompt library and implementation checklist.