Build an AI Answer Evaluation Rubric
ពាក្យថា “ចម្លើយនេះមើលទៅល្អ” មិនប្រាប់ថា ល្អត្រង់ណា ខ្វះអ្វី ឬអាចប្រើបានកម្រិតណាទេ។ Rubric បម្លែងការវាយតម្លៃតាមអារម្មណ៍ទៅជា Criteria, Evidence និងDecision ដែលមនុស្សផ្សេងអាចពិនិត្យឡើងវិញបាន។

- ពន្យល់ធាតុរបស់ Rubric៖ Purpose, Criteria, Levels, Descriptors, Weights និងDecision rule។
- បង្កើត Criteria មិនស្ទួនគ្នា និងអាចរកEvidence វាស់បាន។
- សរសេរ Descriptor កម្រិត ០–៤ ដែលបែងចែកគុណភាពច្បាស់។
- កំណត់ Weight និងHard-stop ស្របតាម Stakes និងUse case។
- Calibrate អ្នកវាយតម្លៃ និងរក្សាScore sheet សម្រាប់Audit។
១. Rubric ជាអ្វី និងមានធាតុអ្វីខ្លះ?
Rubric គឺជាមគ្គុទ្ទេសក៍វាយតម្លៃដែលកំណត់ថា “ត្រូវមើលអ្វី” និង “គុណភាពមួយកម្រិតខុសពីមួយកម្រិតយ៉ាងដូចម្តេច”។ Rubric ល្អមិនមែនជាចម្លើយពិតដោយខ្លួនឯងទេ; វាធ្វើឱ្យការវិនិច្ឆ័យមានស្តង់ដារ តម្លាភាព និងអាចពន្យល់បាន។
ហេតុអ្វីសំខាន់៖ ចម្លើយមាន Style ស្អាតអាចលាក់Citation ក្លែងក្លាយ។ ពិន្ទុសរុបមួយដោយគ្មាន Criteria ក៏មិនប្រាប់ថាត្រូវកែត្រង់ណា។ Rubric បង្ខំឱ្យអ្នកភ្ជាប់ពិន្ទុទៅEvidence និងសេចក្ដីសម្រេចជាក់លាក់។

២. ជ្រើស Criteria ៦ ដែលគ្រប់គ្រាន់ តែមិនស្ទួន
| Criterion | សំណួរវាយតម្លៃ | Evidence ដែលស្វែងរក |
|---|---|---|
| Relevance / Fit | ឆ្លើយត្រូវTask, Audience និងFormat ទេ? | គ្រប់ requirement ត្រូវបានបំពេញ; គ្មានផ្នែកវង្វេង |
| Accuracy & Evidence | Core claims ត្រឹមត្រូវ និងប្រភពគាំទ្រពិតទេ? | Primary sources, date/version, calculation check |
| Completeness & Context | មានខ្វះScope, exception ឬassumption សំខាន់ទេ? | Coverage map, missing context, limits |
| Reasoning & Uncertainty | Conclusion តាមEvidence និងបង្ហាញភាពមិនប្រាកដទេ? | Reasoning chain, alternatives, calibrated language |
| Safety & Bias | មានHarm, privacy leak, one-sided framing ឬguarantee ទេ? | Risk disclosure, protected data, balanced framing |
| Clarity & Actionability | អ្នកអានយល់ថាអ្វីជាFact និងត្រូវធ្វើអ្វីបន្ទាប់ទេ? | Structure, labels, next steps, plain language |
៣. សរសេរ Performance Levels ០–៤ ដែលអាចសង្កេតបាន
Descriptor ល្អពិពណ៌នាភស្តុតាង—not អារម្មណ៍។ ជៀស “អាក្រក់ / មធ្យម / ល្អណាស់” ព្រោះអ្នកវាយពីរនាក់អាចយល់ខុសគ្នា។ ប្រើលំនាំ៖ Coverage + Error severity + Evidence + Effect on use។
| Level | Descriptor ទូទៅ | សេចក្ដីសម្រេចបណ្ដោះអាសន្ន |
|---|---|---|
| ០ — Fail | គ្មានEvidence ឬCore claim ខុសធ្ងន់/បង្កគ្រោះថ្នាក់ | Reject |
| ១ — Weak | ខ្វះផ្នែកសំខាន់ ច្រើន assertion គ្មានsupport | Rebuild |
| ២ — Adequate | គំនិតស្នូលប្រើបាន តែមានgap ឬverification មិនទាន់គ្រប់ | Major revise |
| ៣ — Strong | Claim សំខាន់មានEvidence, Context និងlimits គ្រប់គ្រាន់ | Minor revise |
| ៤ — Exemplary | ត្រឹមត្រូវ ពេញលេញ Traceable និងបង្ហាញuncertainty/alternatives ច្បាស់ | Ready within stated scope |

៤. Weights, Score Bands និងHard Stops
Weights បង្ហាញថាCriterion មួយសំខាន់ជាងមួយទៀតសម្រាប់Use case ណា។ សម្រាប់Caption ទូទៅ Clarity អាចធ្ងន់; សម្រាប់ការស្រាវជ្រាវ Accuracy/Evidence ធ្ងន់; សម្រាប់Finance Accuracy និងSafety ត្រូវធ្ងន់ជាងStyle។ Weights ត្រូវសរុប 100% និងកត់ហេតុផល។
Weighted score = Σ (Rating ÷ 4 × Weight)។ ឧទាហរណ៍ Accuracy = 3/4 និងWeight 30 → 22.5 points។ ប៉ុន្តែHard-stop មានអាទិភាពលើលេខសរុប។
Score Bands គំរូ៖ 85–100 Ready with minor check; 70–84 Targeted revision; 50–69 Major revision; ក្រោម 50 Reject/Rebuild។ Threshold គួរត្រូវបានសាកល្បងលើឧទាហរណ៍ពិត មិនមែនជាច្បាប់សកលទេ។
Interactive Rubric Lab
វាយCriteria នីមួយៗពី ០ ដល់ ៤ ហើយជ្រើសContext។ Lab នឹងប្ដូរWeight និងបង្ហាញCriterion ខ្សោយបំផុត។
៥. Calibration៖ ធ្វើឱ្យអ្នកវាយពីរនាក់យល់Scale ដូចគ្នា
Calibration គឺការឱ្យអ្នកវាយច្រើននាក់ដាក់ពិន្ទុលើចម្លើយគំរូដូចគ្នា រួចប្រៀបធៀបហេតុផល។ បើខុសលើស ១Level ត្រូវត្រឡប់ទៅកែDescriptor ឬបន្ថែមAnchor example។ គោលដៅមិនមែនឱ្យមនុស្សគិតដូចគ្នាទាំងស្រុងទេ តែឱ្យភាពខុសមានEvidence និងអាចដោះស្រាយបាន។
កំហុសញឹកញាប់ និងវិធីកែ
៦. Workflow បង្កើត និងប្រើ Rubric ៦ ជំហាន
លំហាត់អនុវត្ត
បង្កើតCriteria ៥ និងWeights សម្រាប់ AI itinerary ៣ថ្ងៃដែលមានBudget កំណត់។
គំរូពិនិត្យខ្លួនឯង
Relevance 20, Accuracy/Freshness 25, Completeness 20, Safety 20, Clarity 15។ Hard-stop៖ ទីតាំងបិទជាផ្លូវការ ឬការណែនាំសុវត្ថិភាពខុសធ្ងន់។ Descriptor ត្រូវវាស់ចំនួនRequirement, source date និងtransport feasibility។
រៀបRubric សម្រាប់ចម្លើយ AI អំពី Gold setup ដោយមិនធានាចំណេញ។
គំរូពិនិត្យខ្លួនឯង
Accuracy/Evidence 30, Safety/Risk 25, Context 15, Reasoning 15, Relevance 10, Clarity 5។ Hard-stop៖ price/date ក្លែងក្លាយ, guaranteed return, no downside/invalidation ឬលេចaccount credential។
ពិនិត្យការយល់ដឹង
Key Takeaways
- Rubric ភ្ជាប់Purpose, Criteria, Levels, Evidence, Weights និងDecision rule។
- Criteria ល្អគ្រប់Scope ប៉ុន្តែមិនស្ទួន និងមានEvidence ខុសគ្នា។
- Descriptor ត្រូវសង្កេតបាន—not “ល្អ/អាក្រក់” តាមអារម្មណ៍។
- Weights ត្រូវស្របUse case សរុប100 និងមានហេតុផល។
- Hard-stop ការពារCitation ក្លែងក្លាយ, privacy leak និងharm មិនឱ្យពិន្ទុខ្ពស់លាក់បាំង។
- Calibration និងanchor examples កាត់បន្ថយភាពខុសរវាងអ្នកវាយ។
- កត់Rubric version, evidence note និងdecision ដើម្បីAudit និងកែលម្អបាន។
ប្រភពសម្រាប់រៀនបន្ថែម
កំពុងបង្កើតជំនាញវាស់គុណភាព AI
បន្តអានគ្រប់ Checkpoint និងឆ្លើយQuiz ដើម្បីបើកMission Complete។
មេរៀនបន្ទាប់៖ «Verification Workflow និង Audit Trail»។
by 
