មេរៀនទី១៩
PROMPT ARCHITECT • LESSON 19

Evaluation, A/B Testing និង Prompt Versioning

Sot Dimong by Sot Dimong
27 កក្កដា 2026

បញ្ឈប់ការជ្រើស Prompt តាមអារម្មណ៍៖ បង្កើត Test set និង Rubric ដូចគ្នា ប្រៀបធៀប Prompt A/B វាស់ Quality, Safety, Cost និង Latency ហើយចេញ Version ថ្មីតែពេលឆ្លង Release gate។

រយៈពេលប្រហែល ២៣ នាទី
Prompt Mission • Level 19 បង្កើត Evaluation System ដែលអាចប្រៀបធៀប Prompt, រក Regression និងសម្រេច Release/Rollback តាមទិន្នន័យ
+190 XP
ចាប់ផ្តើម
Evaluation A/B Testing និង Prompt Versioning ក្នុង Prompt Engineering
សេចក្តីផ្តើម
Prompt B អាចមើលទៅស្អាតជាង Prompt A ក្នុង Example មួយ ប៉ុន្តែអាចខុស Format, ចំណាយ Token ច្រើន ឬបរាជ័យនៅ Edge case។ Evaluation បម្លែង “ខ្ញុំគិតថាល្អ” ទៅជា Evidence ដែលអាចវាស់ និងធ្វើឡើងវិញបាន។
គោលបំណងមេរៀននេះ
បន្ទាប់ពីរៀនចប់ អ្នកអាចបង្កើត Evaluation contract, Representative test set, Weighted rubric, A/B test, Must-have gate, Error analysis, Version manifest, Changelog និង Rollback plan។

១. Prompt Evaluation ជាអ្វី?

Prompt Evaluation គឺការរត់ Prompt លើ Test cases ដែលបានកំណត់ ហើយវាស់ Output តាម Criteria ថេរ។ គោលដៅមិនមែនរក Prompt ដែល “ឆ្លើយបានម្តង” ទេ ប៉ុន្តែរក Prompt ដែលមានគុណភាពថេរ សុវត្ថិភាព និងចំណាយសមរម្យ។

Task SuccessOutput ដោះស្រាយ Goal និងផ្តល់ Deliverable ដែលអ្នកប្រើត្រូវការ។
QualityAccuracy, Relevance, Completeness, Clarity និង Audience fit។
ComplianceFormat, Required fields, Safety, Privacy, Citation និង stop rules។
EfficiencyLatency, Input/Output tokens, Cost, Retry rate និង Manual-review time។
Spot Checkមើល Output ១–២ ហើយជ្រើសតាមអារម្មណ៍; មិនគ្រប Edge case និងមិនអាចរក Regression។
Evaluation SystemTest set ថេរ + Rubric + Metrics + Error categories + Version comparison + Release gate។
ពិន្ទុសរុបខ្ពស់មិនអាចលុប Critical failure បានទេ។ បើ Fact, Safety, Privacy ឬ Required format សំខាន់ FAIL ត្រូវកំណត់ Hard gate ដើម្បីទប់ Release។

២. បង្កើត Test Set ដែលតំណាងឱ្យការប្រើពិត

Test set ល្អមិនមានតែ Example ងាយៗទេ។ វាត្រូវគ្របដណ្តប់ Input ធម្មតា, Edge case, Missing/Conflicting input, Unsafe request និងករណីដែល Prompt ចាស់ធ្លាប់ខុស។

Happy PathInput គ្រប់ និងច្បាស់; ពិនិត្យថា Prompt បំពេញ Goal និង Format មូលដ្ឋាន។
Edge Caseអត្ថបទវែង, Label ជិតគ្នា, ច្រើនភាសា, unusual format ឬ boundary value។
Missing / ConflictRequired input ខ្វះ ឬ Sources ផ្ទុយគ្នា; Prompt ត្រូវ Ask/Flag—not ទាយ។
Safety / AdversarialPrompt injection, secret request, financial guarantee, private data ឬ unauthorized action។
TEST CASE SCHEMA

CASE_ID • CATEGORY • INPUT • CONTEXT/SOURCES • EXPECTED_BEHAVIOR • MUST_INCLUDE • MUST_NOT_INCLUDE • EXPECTED_FORMAT • SAFETY_EXPECTATION • GOLD_REFERENCE • SEVERITY_IF_FAIL។ កុំដាក់ Gold answer ដែលមាន Fact ចាស់ដោយគ្មាន Version/Date។

Test Set Rubric Metrics A/B Comparison Error Analysis និង Version Release
A/B EVALUATION LAB

ជ្រើស TEST • កំណត់ RUBRIC និង GATE

READY

ជ្រើស Scenario ដើម្បីមើល Test case, Metric និងលក្ខខណ្ឌសម្រេច Winner។

TESTCaption QualityKhmer educational content
EVAL
ENGINE
MEASUREQUALITY RUBRICAccuracy • Relevance • Format • Safety
Test cases៖ Happy ២, Edge ១, Missing source ១, Unsafe guarantee ១។ Weights៖ Accuracy 30%, Relevance 20%, Format 20%, Clarity 15%, Safety 15%។ Hard gate៖ fabricated fact, guarantee ឬ missing risk note → FAIL។

៣. Rubric, Metrics និង Scoring

Rubric ប្រាប់ថា “ល្អ” មានន័យអ្វី។ Criteria នីមួយៗត្រូវមាន Definition, Scale, Weight, Evidence និង Failure severity ដើម្បីឱ្យអ្នកវាយតម្លៃពីរនាក់យល់ដូចគ្នាខ្លាំងបំផុត។

AccuracyFact/Calculation ត្រឹមត្រូវ និងមាន Evidence; កុំផ្តល់ពិន្ទុពី Style។
Relevanceឆ្លើយ Goal ដោយផ្ទាល់ មិនបញ្ចូលព័ត៌មានរំខាន ឬចាកចេញពី Scope។
FormatRequired sections, fields, order, length, JSON schema និង platform constraints។
SafetyPrivacy, injection resistance, no guarantee, no unauthorized action និង correct escalation។
WEIGHTED SCORE

TOTAL = Σ(CRITERION_SCORE ÷ MAX_SCORE × WEIGHT)។ ឧទាហរណ៍ Accuracy 30%, Relevance 20%, Format 20%, Clarity 15%, Safety 15%។ បង្ហាញ Raw score, weighted score និង Evidence។ HARD GATE៖ Accuracy/Safety/Privacy critical FAIL → FINAL=FAIL ទោះ Total ខ្ពស់ក៏ដោយ។

AI-as-judge អាចជួយ First pass ប៉ុន្តែអាច Bias និងមិនឃើញ Fact ខុស។ ប្រើ Rule-based checks សម្រាប់ Schema/length, Source verification សម្រាប់ Fact និង Human review សម្រាប់ High-stakes ឬ subjective quality។

៤. A/B Testing ដែលមានយុត្តិធម៌

Prompt A និង B ត្រូវរត់លើ Test cases និង Evaluation criteria ដូចគ្នា។ រក្សា Model, Settings, Context, Tools, Source version និង Run policy ឱ្យដូចគ្នា; ប្តូរតែ Prompt element ដែលចង់សាកល្បង។

CONTROLTest set, rubric, model/version, temperature, tools, sources, max tokens និង evaluator ថេរ។
VARIABLEប្តូរតែ Instruction, Example, Output contract ឬ fallback rule មួយក្រុមដែលបានកត់ត្រា។
REPEATED RUNSបើ Output មាន variability ត្រូវរត់ច្រើនដង និងប្រៀបធៀប Mean, failure rate និង consistency។
PAIRWISE REVIEWប្រៀបធៀប Output A/B លើ Case ដូចគ្នា; បង្ហាញ Winner, Tie, Reason និង confidence។
Fair TestSame cases + same rubric + same conditions + blind order + logged runs + predefined release threshold។
Biased TestPrompt B ទទួល Input ងាយជាង, evaluator ដឹង preferred version, metrics ប្តូរក្រោយឃើញលទ្ធផល ឬលាក់ failed cases។

៥. Prompt Versioning, Regression និង Release

Prompt គួរមាន ID និង Version ដូច Code។ រក្សា Baseline, Owner, Change reason, Model/settings, Test report, Known limitations និង Rollback target។ កុំសរសេរជាន់ Version ដែលកំពុងប្រើ។

Version IDPROMPT_ID + semantic version ឬ release number; ឧ. dmtrade.caption.v1.2។
Changelogអ្វីបានប្តូរ, ហេតុអ្វី, expected effect, owner, date និង test result។
RegressionVersion ថ្មីល្អផ្នែកមួយ ប៉ុន្តែធ្វើឱ្យ Case ដែលធ្លាប់ PASS ប្រែជា FAIL។
Rollbackត្រឡប់ Baseline ដែលបានផ្ទៀងផ្ទាត់ បើ Production quality, safety ឬ cost លើស threshold។
RELEASE MANIFEST

PROMPT_ID • VERSION • OWNER • STATUS=[DRAFT|CANDIDATE|RELEASED|ROLLED_BACK] • BASELINE_VERSION • MODEL/SETTINGS • TEST_SET_VERSION • RUBRIC_VERSION • SCORES • CRITICAL_FAILURES • COST/LATENCY • CHANGELOG • KNOWN_LIMITATIONS • RELEASE_APPROVER • ROLLBACK_TARGET។

ដំណើរការ Define Test Run Prompt A/B Score Analyze Release និង Monitor

៦. រូបមន្តអនុវត្ត៖ DMTrade Prompt A/B Evaluator

Prompt ខាងក្រោមប្រៀបធៀប Prompt A និង B ដោយប្រើ Test set/Rubric ដូចគ្នា បង្ហាញ Error categories, Quality/Cost trade-off និង Release recommendation ដែលអាច Audit បាន។

សាកអនុវត្ត • EVALUATION CONTRACT

ROLE៖ អ្នកជា Prompt Evaluation Analyst សម្រាប់ dmtrade.app។ GOAL៖ ប្រៀបធៀប PROMPT_A=[version] និង PROMPT_B=[version] លើ TEST_SET=[version] ដើម្បីសម្រេច KEEP_A, RELEASE_B, REVISE ឬ HUMAN_REVIEW។ FAIRNESS RULE៖ ប្រើ Test cases, rubric, model/version, temperature, tools, source snapshot, max tokens និង run count ដូចគ្នា; ប្តូរតែ Prompt version។ INPUTS៖ PROMPT_A, PROMPT_B, TEST_CASES, RUBRIC, MODEL_SETTINGS, COST_DATA, LATENCY_DATA, RELEASE_THRESHOLDS។ TEST CATEGORIES៖ Happy path, Edge case, Missing/conflicting input, Format/schema, Safety/privacy និង Historical regression។ RUBRIC៖ Accuracy 30%, Relevance 20%, Format compliance 20%, Clarity/Audience fit 15%, Safety 15%។ SCALE៖ 0=Fail, 1=Major issue, 2=Partial, 3=Pass, 4=Excellent; ផ្តល់ Evidence សម្រាប់ពិន្ទុនីមួយៗ។ HARD GATES៖ Fabricated fact/source, critical calculation error, privacy leak, unsafe guarantee, unauthorized action, invalid required schema ឬ Prompt injection compliance → CASE FAIL និង VERSION មិនអាច RELEASE។ PROCESS៖ ១) Validate inputs និងបង្ហាញអ្វីខ្វះ។ ២) Run/inspect A និង B លើ Case ដូចគ្នា។ ៣) Score ដោយមិនប្រើ Style ដើម្បីជំនួស Accuracy។ ៤) គណនា weighted score, must-have pass rate, critical failures, retry rate, average tokens, cost និង latency។ ៥) បង្ហាញ Pairwise winner/tie និង reason សម្រាប់គ្រប់ Case។ ៦) ធ្វើ Error analysis តាម Category និងរក Regression ដែល A PASS តែ B FAIL។ ៧) ប្រៀបធៀប Quality gain ជាមួយ Cost/Latency change។ RELEASE RULE៖ RELEASE_B តែពេល Must-have tests=100% PASS, គ្មាន Critical fail/regression, weighted score កើនយ៉ាងតិច [5%] និង Cost/Latency មិនលើស Budget។ បើលទ្ធផលជិតគ្នា ឬ subjective → HUMAN_REVIEW។ OUTPUT៖ A. EXPERIMENT MANIFEST; B. CASE-BY-CASE TABLE [CASE,A_SCORE,B_SCORE,WINNER,EVIDENCE]; C. METRIC SUMMARY; D. CRITICAL FAILURES; E. REGRESSION REPORT; F. COST/LATENCY; G. ERROR CATEGORIES; H. RELEASE DECISION + CONFIDENCE; I. CHANGELOG DRAFT; J. ROLLBACK TARGET។ កុំលាក់ Failed case និងកុំប្តូរ Rubric ក្រោយឃើញ Winner។

៧. ពិនិត្យការយល់ដឹង

QUIZ ខ្លី

A/B Test Prompt ត្រូវរក្សាអ្វីឱ្យដូចគ្នា ដើម្បីឱ្យការប្រៀបធៀបមានយុត្តិធម៌?

ចម្លើយត្រឹមត្រូវ៖ ខ។ Dataset, Rubric និង Run conditions ដូចគ្នាធ្វើឱ្យភាពខុសគ្នានៃលទ្ធផលអាចភ្ជាប់ទៅ Prompt version ដែលកំពុងសាកល្បងបាន។

៨. ចំណុចសំខាន់ដែលត្រូវចងចាំ

  • Evaluation ត្រូវមាន Goal, Test set, Rubric, Metrics, Hard gates និង Release threshold ដែលកំណត់ជាមុន។
  • Test set គួរគ្រប Happy path, Edge, Missing/conflict, Safety និង Historical regression cases។
  • A/B Test ត្រូវរក្សា Model, Settings, Context, Tools, Dataset និង Rubric ដូចគ្នា។
  • វាស់ទាំង Quality, Safety, Format, Consistency, Cost, Latency និង Manual-review burden។
  • គ្រប់ Prompt release ត្រូវមាន Version, Changelog, Test report, Known limitations និង Rollback target។

រូបមន្តសាមញ្ញ៖ «Define success → Build test set → Score with rubric → Compare A/B → Analyze errors → Release or rollback»។

លំហាត់អនុវត្ត៖ បង្កើត Rubric និង Test cases ៥ សម្រាប់ប្រៀបធៀប Prompt A និង B រួមមាន Happy, Edge, Missing, Unsafe និង Regression case។

PROMPT ARCHITECT BADGE

កំពុងពង្រឹង Prompt Evaluation របស់អ្នក

បន្តអានគ្រប់ Checkpoint និងឆ្លើយ Quiz ដើម្បីបើកស្ថានភាព Mission Complete របស់អ្នក។

0% • Prompt Architect កំពុងដំណើរការ បន្តមេរៀនទី២០

សូមត្រៀមខ្លួនសម្រាប់មេរៀនបន្ទាប់៖ «មេរៀនទី២០៖ Capstone: Prompt Operating System»។

មេរៀនផ្សេងទៀត

មេរៀនផ្សេងទៀត

ទំព័រដើម
រៀនត្រេត
រៀន AI
ការកំណត់