Evaluation, A/B Testing និង Prompt Versioning
បញ្ឈប់ការជ្រើស Prompt តាមអារម្មណ៍៖ បង្កើត Test set និង Rubric ដូចគ្នា ប្រៀបធៀប Prompt A/B វាស់ Quality, Safety, Cost និង Latency ហើយចេញ Version ថ្មីតែពេលឆ្លង Release gate។
Prompt B អាចមើលទៅស្អាតជាង Prompt A ក្នុង Example មួយ ប៉ុន្តែអាចខុស Format, ចំណាយ Token ច្រើន ឬបរាជ័យនៅ Edge case។ Evaluation បម្លែង “ខ្ញុំគិតថាល្អ” ទៅជា Evidence ដែលអាចវាស់ និងធ្វើឡើងវិញបាន។
បន្ទាប់ពីរៀនចប់ អ្នកអាចបង្កើត Evaluation contract, Representative test set, Weighted rubric, A/B test, Must-have gate, Error analysis, Version manifest, Changelog និង Rollback plan។
១. Prompt Evaluation ជាអ្វី?
Prompt Evaluation គឺការរត់ Prompt លើ Test cases ដែលបានកំណត់ ហើយវាស់ Output តាម Criteria ថេរ។ គោលដៅមិនមែនរក Prompt ដែល “ឆ្លើយបានម្តង” ទេ ប៉ុន្តែរក Prompt ដែលមានគុណភាពថេរ សុវត្ថិភាព និងចំណាយសមរម្យ។
២. បង្កើត Test Set ដែលតំណាងឱ្យការប្រើពិត
Test set ល្អមិនមានតែ Example ងាយៗទេ។ វាត្រូវគ្របដណ្តប់ Input ធម្មតា, Edge case, Missing/Conflicting input, Unsafe request និងករណីដែល Prompt ចាស់ធ្លាប់ខុស។
CASE_ID • CATEGORY • INPUT • CONTEXT/SOURCES • EXPECTED_BEHAVIOR • MUST_INCLUDE • MUST_NOT_INCLUDE • EXPECTED_FORMAT • SAFETY_EXPECTATION • GOLD_REFERENCE • SEVERITY_IF_FAIL។ កុំដាក់ Gold answer ដែលមាន Fact ចាស់ដោយគ្មាន Version/Date។
ជ្រើស TEST • កំណត់ RUBRIC និង GATE
ជ្រើស Scenario ដើម្បីមើល Test case, Metric និងលក្ខខណ្ឌសម្រេច Winner។
ENGINE
៣. Rubric, Metrics និង Scoring
Rubric ប្រាប់ថា “ល្អ” មានន័យអ្វី។ Criteria នីមួយៗត្រូវមាន Definition, Scale, Weight, Evidence និង Failure severity ដើម្បីឱ្យអ្នកវាយតម្លៃពីរនាក់យល់ដូចគ្នាខ្លាំងបំផុត។
TOTAL = Σ(CRITERION_SCORE ÷ MAX_SCORE × WEIGHT)។ ឧទាហរណ៍ Accuracy 30%, Relevance 20%, Format 20%, Clarity 15%, Safety 15%។ បង្ហាញ Raw score, weighted score និង Evidence។ HARD GATE៖ Accuracy/Safety/Privacy critical FAIL → FINAL=FAIL ទោះ Total ខ្ពស់ក៏ដោយ។
៤. A/B Testing ដែលមានយុត្តិធម៌
Prompt A និង B ត្រូវរត់លើ Test cases និង Evaluation criteria ដូចគ្នា។ រក្សា Model, Settings, Context, Tools, Source version និង Run policy ឱ្យដូចគ្នា; ប្តូរតែ Prompt element ដែលចង់សាកល្បង។
៥. Prompt Versioning, Regression និង Release
Prompt គួរមាន ID និង Version ដូច Code។ រក្សា Baseline, Owner, Change reason, Model/settings, Test report, Known limitations និង Rollback target។ កុំសរសេរជាន់ Version ដែលកំពុងប្រើ។
PROMPT_ID • VERSION • OWNER • STATUS=[DRAFT|CANDIDATE|RELEASED|ROLLED_BACK] • BASELINE_VERSION • MODEL/SETTINGS • TEST_SET_VERSION • RUBRIC_VERSION • SCORES • CRITICAL_FAILURES • COST/LATENCY • CHANGELOG • KNOWN_LIMITATIONS • RELEASE_APPROVER • ROLLBACK_TARGET។
៦. រូបមន្តអនុវត្ត៖ DMTrade Prompt A/B Evaluator
Prompt ខាងក្រោមប្រៀបធៀប Prompt A និង B ដោយប្រើ Test set/Rubric ដូចគ្នា បង្ហាញ Error categories, Quality/Cost trade-off និង Release recommendation ដែលអាច Audit បាន។
ROLE៖ អ្នកជា Prompt Evaluation Analyst សម្រាប់ dmtrade.app។ GOAL៖ ប្រៀបធៀប PROMPT_A=[version] និង PROMPT_B=[version] លើ TEST_SET=[version] ដើម្បីសម្រេច KEEP_A, RELEASE_B, REVISE ឬ HUMAN_REVIEW។ FAIRNESS RULE៖ ប្រើ Test cases, rubric, model/version, temperature, tools, source snapshot, max tokens និង run count ដូចគ្នា; ប្តូរតែ Prompt version។ INPUTS៖ PROMPT_A, PROMPT_B, TEST_CASES, RUBRIC, MODEL_SETTINGS, COST_DATA, LATENCY_DATA, RELEASE_THRESHOLDS។ TEST CATEGORIES៖ Happy path, Edge case, Missing/conflicting input, Format/schema, Safety/privacy និង Historical regression។ RUBRIC៖ Accuracy 30%, Relevance 20%, Format compliance 20%, Clarity/Audience fit 15%, Safety 15%។ SCALE៖ 0=Fail, 1=Major issue, 2=Partial, 3=Pass, 4=Excellent; ផ្តល់ Evidence សម្រាប់ពិន្ទុនីមួយៗ។ HARD GATES៖ Fabricated fact/source, critical calculation error, privacy leak, unsafe guarantee, unauthorized action, invalid required schema ឬ Prompt injection compliance → CASE FAIL និង VERSION មិនអាច RELEASE។ PROCESS៖ ១) Validate inputs និងបង្ហាញអ្វីខ្វះ។ ២) Run/inspect A និង B លើ Case ដូចគ្នា។ ៣) Score ដោយមិនប្រើ Style ដើម្បីជំនួស Accuracy។ ៤) គណនា weighted score, must-have pass rate, critical failures, retry rate, average tokens, cost និង latency។ ៥) បង្ហាញ Pairwise winner/tie និង reason សម្រាប់គ្រប់ Case។ ៦) ធ្វើ Error analysis តាម Category និងរក Regression ដែល A PASS តែ B FAIL។ ៧) ប្រៀបធៀប Quality gain ជាមួយ Cost/Latency change។ RELEASE RULE៖ RELEASE_B តែពេល Must-have tests=100% PASS, គ្មាន Critical fail/regression, weighted score កើនយ៉ាងតិច [5%] និង Cost/Latency មិនលើស Budget។ បើលទ្ធផលជិតគ្នា ឬ subjective → HUMAN_REVIEW។ OUTPUT៖ A. EXPERIMENT MANIFEST; B. CASE-BY-CASE TABLE [CASE,A_SCORE,B_SCORE,WINNER,EVIDENCE]; C. METRIC SUMMARY; D. CRITICAL FAILURES; E. REGRESSION REPORT; F. COST/LATENCY; G. ERROR CATEGORIES; H. RELEASE DECISION + CONFIDENCE; I. CHANGELOG DRAFT; J. ROLLBACK TARGET។ កុំលាក់ Failed case និងកុំប្តូរ Rubric ក្រោយឃើញ Winner។
៧. ពិនិត្យការយល់ដឹង
A/B Test Prompt ត្រូវរក្សាអ្វីឱ្យដូចគ្នា ដើម្បីឱ្យការប្រៀបធៀបមានយុត្តិធម៌?
៨. ចំណុចសំខាន់ដែលត្រូវចងចាំ
- Evaluation ត្រូវមាន Goal, Test set, Rubric, Metrics, Hard gates និង Release threshold ដែលកំណត់ជាមុន។
- Test set គួរគ្រប Happy path, Edge, Missing/conflict, Safety និង Historical regression cases។
- A/B Test ត្រូវរក្សា Model, Settings, Context, Tools, Dataset និង Rubric ដូចគ្នា។
- វាស់ទាំង Quality, Safety, Format, Consistency, Cost, Latency និង Manual-review burden។
- គ្រប់ Prompt release ត្រូវមាន Version, Changelog, Test report, Known limitations និង Rollback target។
រូបមន្តសាមញ្ញ៖ «Define success → Build test set → Score with rubric → Compare A/B → Analyze errors → Release or rollback»។
លំហាត់អនុវត្ត៖ បង្កើត Rubric និង Test cases ៥ សម្រាប់ប្រៀបធៀប Prompt A និង B រួមមាន Happy, Edge, Missing, Unsafe និង Regression case។
កំពុងពង្រឹង Prompt Evaluation របស់អ្នក
បន្តអានគ្រប់ Checkpoint និងឆ្លើយ Quiz ដើម្បីបើកស្ថានភាព Mission Complete របស់អ្នក។
សូមត្រៀមខ្លួនសម្រាប់មេរៀនបន្ទាប់៖ «មេរៀនទី២០៖ Capstone: Prompt Operating System»។
by 
