មេរៀនទី១៨
QUALITY RUBRIC LAB • LESSON 18

Build an AI Answer Evaluation Rubric

Sot Dimong by Sot Dimong
២ សីហា 2026

ពាក្យថា “ចម្លើយនេះមើលទៅល្អ” មិនប្រាប់ថា ល្អត្រង់ណា ខ្វះអ្វី ឬអាចប្រើបានកម្រិតណាទេ។ Rubric បម្លែងការវាយតម្លៃតាមអារម្មណ៍ទៅជា Criteria, Evidence និងDecision ដែលមនុស្សផ្សេងអាចពិនិត្យឡើងវិញបាន។

ប្រហែល ៣៥ នាទី
Rubric Architect • Level 18PURPOSE → CRITERIA → LEVELS → WEIGHTS → CALIBRATE → DECIDE 0 XP
ចាប់ផ្តើម
មេរៀនទី១៨ AI Answer Evaluation Rubric បង្ហាញម៉ាស៊ីនវាយតម្លៃ Criteria និងQuality gate
គោលបំណងសិក្សា
  • ពន្យល់ធាតុរបស់ Rubric៖ Purpose, Criteria, Levels, Descriptors, Weights និងDecision rule។
  • បង្កើត Criteria មិនស្ទួនគ្នា និងអាចរកEvidence វាស់បាន។
  • សរសេរ Descriptor កម្រិត ០–៤ ដែលបែងចែកគុណភាពច្បាស់។
  • កំណត់ Weight និងHard-stop ស្របតាម Stakes និងUse case។
  • Calibrate អ្នកវាយតម្លៃ និងរក្សាScore sheet សម្រាប់Audit។

១. Rubric ជាអ្វី និងមានធាតុអ្វីខ្លះ?

Rubric គឺជាមគ្គុទ្ទេសក៍វាយតម្លៃដែលកំណត់ថា “ត្រូវមើលអ្វី” និង “គុណភាពមួយកម្រិតខុសពីមួយកម្រិតយ៉ាងដូចម្តេច”។ Rubric ល្អមិនមែនជាចម្លើយពិតដោយខ្លួនឯងទេ; វាធ្វើឱ្យការវិនិច្ឆ័យមានស្តង់ដារ តម្លាភាព និងអាចពន្យល់បាន។

PurposeOutput នេះប្រើសម្រាប់អ្នកណា សម្រេចអ្វី និង Stakes កម្រិតណា?
Criteriaមុំគុណភាពដាច់ពីគ្នា ដូចជា Accuracy, Relevance និងSafety។
Levels + Descriptorsកម្រិត ០–៤ និងការពិពណ៌នាដែលសង្កេតបានសម្រាប់កម្រិតនីមួយៗ។
Weights + Rulesទម្ងន់តាមសារៈសំខាន់, threshold និងHard-stop ដែលមិនអាចប៉ះប៉ូវដោយពិន្ទុខ្ពស់ផ្សេង។

ហេតុអ្វីសំខាន់៖ ចម្លើយមាន Style ស្អាតអាចលាក់Citation ក្លែងក្លាយ។ ពិន្ទុសរុបមួយដោយគ្មាន Criteria ក៏មិនប្រាប់ថាត្រូវកែត្រង់ណា។ Rubric បង្ខំឱ្យអ្នកភ្ជាប់ពិន្ទុទៅEvidence និងសេចក្ដីសម្រេចជាក់លាក់។

Criteria របស់ AI Answer Rubric ៦៖ Relevance Accuracy Completeness Reasoning Safety និងClarity

២. ជ្រើស Criteria ៦ ដែលគ្រប់គ្រាន់ តែមិនស្ទួន

Criterionសំណួរវាយតម្លៃEvidence ដែលស្វែងរក
Relevance / Fitឆ្លើយត្រូវTask, Audience និងFormat ទេ?គ្រប់ requirement ត្រូវបានបំពេញ; គ្មានផ្នែកវង្វេង
Accuracy & EvidenceCore claims ត្រឹមត្រូវ និងប្រភពគាំទ្រពិតទេ?Primary sources, date/version, calculation check
Completeness & Contextមានខ្វះScope, exception ឬassumption សំខាន់ទេ?Coverage map, missing context, limits
Reasoning & UncertaintyConclusion តាមEvidence និងបង្ហាញភាពមិនប្រាកដទេ?Reasoning chain, alternatives, calibrated language
Safety & BiasមានHarm, privacy leak, one-sided framing ឬguarantee ទេ?Risk disclosure, protected data, balanced framing
Clarity & Actionabilityអ្នកអានយល់ថាអ្វីជាFact និងត្រូវធ្វើអ្វីបន្ទាប់ទេ?Structure, labels, next steps, plain language
ជីវិតប្រចាំថ្ងៃវាយតម្លៃផែនការធ្វើដំណើរ៖ Relevance ទៅBudget/ថ្ងៃ, Accuracy ទៅម៉ោងបើក, Completeness ទៅtransport និងSafety ទៅតំបន់ហានិភ័យ។
សិក្សា/ការងារវាយSummary របាយការណ៍៖ claim ស្របឯកសារដើម, មិនលុបexception, បែងចែក fact/inference និងរក្សាconfidentiality។
Trading/FinanceវាយAnalysis XAU/USD៖ timestamp និងdata source, assumption, downside, invalidation, fee/leverage និងគ្មានការធានាចំណេញ។

៣. សរសេរ Performance Levels ០–៤ ដែលអាចសង្កេតបាន

Descriptor ល្អពិពណ៌នាភស្តុតាង—not អារម្មណ៍។ ជៀស “អាក្រក់ / មធ្យម / ល្អណាស់” ព្រោះអ្នកវាយពីរនាក់អាចយល់ខុសគ្នា។ ប្រើលំនាំ៖ Coverage + Error severity + Evidence + Effect on use។

LevelDescriptor ទូទៅសេចក្ដីសម្រេចបណ្ដោះអាសន្ន
០ — Failគ្មានEvidence ឬCore claim ខុសធ្ងន់/បង្កគ្រោះថ្នាក់Reject
១ — Weakខ្វះផ្នែកសំខាន់ ច្រើន assertion គ្មានsupportRebuild
២ — Adequateគំនិតស្នូលប្រើបាន តែមានgap ឬverification មិនទាន់គ្រប់Major revise
៣ — StrongClaim សំខាន់មានEvidence, Context និងlimits គ្រប់គ្រាន់Minor revise
៤ — Exemplaryត្រឹមត្រូវ ពេញលេញ Traceable និងបង្ហាញuncertainty/alternatives ច្បាស់Ready within stated scope
Wrong ១Accuracy: 1=អាក្រក់, 2=មធ្យម, 3=ល្អ, 4=ល្អណាស់។ មិនប្រាប់ថាត្រូវពិនិត្យEvidence ឬerror severity អ្វីទេ។
Better ១Accuracy Level ៣៖ Core claims ទាំងអស់គាំទ្រដោយប្រភពសមស្រប; minor detail មួយមិនទាន់verify ប៉ុន្តែមិនប្ដូរConclusion។
Wrong ២ចម្លើយបាន 86/100 ដូច្នេះAccept ទោះមានCitation ក្លែងក្លាយមួយ និងបញ្ចូលAPI key ក្នុងឧទាហរណ៍។
Better ២Hard-stop លើ fabricated citation និងsecret exposure៖ ដាក់Status “Do not use”, កែIncident ហើយវាយឡើងវិញពីEvidence ថ្មី។
Workflow បង្កើត Rubric ៦ ជំហាន៖ Goal Criteria Levels Weight Calibration និងDecision

៤. Weights, Score Bands និងHard Stops

Weights បង្ហាញថាCriterion មួយសំខាន់ជាងមួយទៀតសម្រាប់Use case ណា។ សម្រាប់Caption ទូទៅ Clarity អាចធ្ងន់; សម្រាប់ការស្រាវជ្រាវ Accuracy/Evidence ធ្ងន់; សម្រាប់Finance Accuracy និងSafety ត្រូវធ្ងន់ជាងStyle។ Weights ត្រូវសរុប 100% និងកត់ហេតុផល។

Formula
Weighted score = Σ (Rating ÷ 4 × Weight)។ ឧទាហរណ៍ Accuracy = 3/4 និងWeight 30 → 22.5 points។ ប៉ុន្តែHard-stop មានអាទិភាពលើលេខសរុប។

Score Bands គំរូ៖ 85–100 Ready with minor check; 70–84 Targeted revision; 50–69 Major revision; ក្រោម 50 Reject/Rebuild។ Threshold គួរត្រូវបានសាកល្បងលើឧទាហរណ៍ពិត មិនមែនជាច្បាប់សកលទេ។

Interactive Rubric Lab

វាយCriteria នីមួយៗពី ០ ដល់ ៤ ហើយជ្រើសContext។ Lab នឹងប្ដូរWeight និងបង្ហាញCriterion ខ្សោយបំផុត។

2
2
2
2
2
2
Hard Stops
កែ Slider និងចុច «គណនាពិន្ទុ»។

៥. Calibration៖ ធ្វើឱ្យអ្នកវាយពីរនាក់យល់Scale ដូចគ្នា

Calibration គឺការឱ្យអ្នកវាយច្រើននាក់ដាក់ពិន្ទុលើចម្លើយគំរូដូចគ្នា រួចប្រៀបធៀបហេតុផល។ បើខុសលើស ១Level ត្រូវត្រឡប់ទៅកែDescriptor ឬបន្ថែមAnchor example។ គោលដៅមិនមែនឱ្យមនុស្សគិតដូចគ្នាទាំងស្រុងទេ តែឱ្យភាពខុសមានEvidence និងអាចដោះស្រាយបាន។

កំហុសញឹកញាប់ និងវិធីកែ

Criteria ស្ទួនកែ៖ សួរថាCriterion នីមួយៗចាប់Evidence ខុសគ្នាអ្វី; merge បើព្រំដែនមិនច្បាស់។
Descriptor តាមអារម្មណ៍កែ៖ ប្រើobservable evidence, error severity និងeffect on use។
Weight មិនសរុប 100កែ៖ normalize និងសរសេរហេតុផលតាមStakes។
មិនCalibrateកែ៖ score anchor answers, ពិភាក្សាភាពខុស និងversion rubric។

៦. Workflow បង្កើត និងប្រើ Rubric ៦ ជំហាន

កំណត់Purpose និងDecisionRubric ប្រើសម្រាប់ជ្រើសចម្លើយ កែសម្រួល ឬpublish? អ្នកអាន និងStakes ជាអ្វី?
ជ្រើស Criteriaយក 5–7មុំដែលគ្រប់Scope និងមិនស្ទួន; កំណត់Evidence សម្រាប់មុំទាំងអស់។
សរសេរ Levelsចាប់ពីFail និងExemplary រួចសរសេរកម្រិតកណ្ដាលដោយerror severity និងcoverage។
កំណត់Weights/Hard StopsWeights សរុប100; កំណត់អ្វីដែលពិន្ទុផ្សេងមិនអាចប៉ះប៉ូវ។
Calibrate និងPilotឱ្យអ្នកវាយពីរនាក់score anchor answers; កែDescriptor និងthreshold តាមភាពខុស។
Score, Decide និងRecordកត់score per criterion, evidence note, hard-stop, reviewer, rubric version និងnext action។

លំហាត់អនុវត្ត

លំហាត់ ១៖ Rubric សម្រាប់ផែនការធ្វើដំណើរ

បង្កើតCriteria ៥ និងWeights សម្រាប់ AI itinerary ៣ថ្ងៃដែលមានBudget កំណត់។

គំរូពិនិត្យខ្លួនឯង

Relevance 20, Accuracy/Freshness 25, Completeness 20, Safety 20, Clarity 15។ Hard-stop៖ ទីតាំងបិទជាផ្លូវការ ឬការណែនាំសុវត្ថិភាពខុសធ្ងន់។ Descriptor ត្រូវវាស់ចំនួនRequirement, source date និងtransport feasibility។

លំហាត់ ២៖ Rubric សម្រាប់ Trading analysis

រៀបRubric សម្រាប់ចម្លើយ AI អំពី Gold setup ដោយមិនធានាចំណេញ។

គំរូពិនិត្យខ្លួនឯង

Accuracy/Evidence 30, Safety/Risk 25, Context 15, Reasoning 15, Relevance 10, Clarity 5។ Hard-stop៖ price/date ក្លែងក្លាយ, guaranteed return, no downside/invalidation ឬលេចaccount credential។

ពិនិត្យការយល់ដឹង

QUIZ ៥ សំណួរ
ពិន្ទុ៖ ០/៥

Key Takeaways

  • Rubric ភ្ជាប់Purpose, Criteria, Levels, Evidence, Weights និងDecision rule។
  • Criteria ល្អគ្រប់Scope ប៉ុន្តែមិនស្ទួន និងមានEvidence ខុសគ្នា។
  • Descriptor ត្រូវសង្កេតបាន—not “ល្អ/អាក្រក់” តាមអារម្មណ៍។
  • Weights ត្រូវស្របUse case សរុប100 និងមានហេតុផល។
  • Hard-stop ការពារCitation ក្លែងក្លាយ, privacy leak និងharm មិនឱ្យពិន្ទុខ្ពស់លាក់បាំង។
  • Calibration និងanchor examples កាត់បន្ថយភាពខុសរវាងអ្នកវាយ។
  • កត់Rubric version, evidence note និងdecision ដើម្បីAudit និងកែលម្អបាន។

ប្រភពសម្រាប់រៀនបន្ថែម

RUBRIC ARCHITECT BADGE

កំពុងបង្កើតជំនាញវាស់គុណភាព AI

បន្តអានគ្រប់ Checkpoint និងឆ្លើយQuiz ដើម្បីបើកMission Complete។

0% • Rubric Architect កំពុងដំណើរការបន្តមេរៀនទី១៩

មេរៀនបន្ទាប់៖ «Verification Workflow និង Audit Trail»។

មេរៀនផ្សេងទៀត

មេរៀនផ្សេងទៀត

ទំព័រដើម
រៀនត្រេត
រៀន AI
ការកំណត់