មេរៀនទី៨
DOCUMENT INTELLIGENCE • LESSON ៨

Structured Data Extraction

Sot Dimong by Sot Dimong
១៨ សីហា ២០២៦

ដក Names, Dates, Amounts, Clauses និង Fields ទៅ Table ឬ JSON ដោយមាន Validation rules ។

រយៈពេលប្រហែល ២២ នាទី
Document Mission • Level 2 🧾 Information Extractor 0 XP
ចាប់ផ្តើម
Structured Data Extraction
សេចក្តីផ្តើម
នៅក្នុងស្ថាប័នធំៗ ការបញ្ចូលទិន្នន័យពីវិក្កយបត្ររាប់ពាន់សន្លឹក ឬទម្រង់បែបបទចុះឈ្មោះអតិថិជនទៅក្នុងប្រព័ន្ធកុំព្យូទ័រដោយដៃ (Manual Data Entry) មិនត្រឹមតែស៊ីពេលរាប់រយម៉ោងប៉ុណ្ណោះទេ ប៉ុន្តែថែមទាំងមានអត្រាកំហុសខ្ពស់ (Typo Errors)។

Structured Data Extraction គឺជាការប្រើប្រាស់ AI ដើម្បីអានឯកសារ និងស្រង់ទិន្នន័យ Key-Value Pairs ជាក់លាក់ទៅជាទម្រង់ **JSON, CSV ឬ Database Table** ស្វ័យប្រវត្តិតាម Schema ដែលបានកំណត់ទុកជាមុន។ នៅក្នុងមេរៀននេះ អ្នកនឹងរៀនពីបច្ចេកទេសស្រង់ទិន្នន័យកម្រិតខ្ពស់ដែលមាន Validation ត្រឹមត្រូវ!

គោលបំណងនៃមេរៀននេះ

ចេះរចនា JSON Schema និង Prompt សម្រាប់ស្រង់ទិន្នន័យស្មុគស្មាញពីវិក្កយបត្រ បង្កាន់ដៃ កិច្ចសន្យា និងទម្រង់បែបបទ ដោយមានវិធានផ្ទៀងផ្ទាត់ (Validation Rules) ដើម្បីការពារទិន្នន័យស្ទួន ឬលេខខុសទម្រង់ ត្រៀមបញ្ចូលទៅក្នុង Database/ERP ដោយស្វ័យប្រវត្តិ។

១. ស្ថាបត្យកម្ម Schema-Driven Extraction

ការស្រង់ទិន្នន័យត្រូវតែមាន Schema ណែនាំជាមុនដើម្បីធានាភាពថេរនៃទិន្នន័យ ៖

១. Strict Type Definition កំណត់ប្រភេទ Field ឱ្យបានច្បាស់លាស់ ៖ string (ឈ្មោះ), number/float (តម្លៃទឹកប្រាក់), date (YYYY-MM-DD), array (បញ្ជីមុខទំនិញ)។
២. Validation & Constraint Rules កំណត់លក្ខខណ្ឌផ្ទៀងផ្ទាត់ ៖ តើផលបូក Line Items ស្មើនឹង Grand Total ដែរឬទេ? តើកាលបរិច្ឆេទ Issue Date កើតមុន Due Date ដែរឬទេ?
៣. Missing Value Strategy បង្គាប់ឱ្យ AI ប្រើប្រាស់តម្លៃ null"N/A" ប្រសិនបើទិន្នន័យនោះមិនមានចែងក្នុងឯកសារ ហាមដាច់ខាតមិនឱ្យប្រឌិតទិន្នន័យបំពេញជំនួស។
៤. Multi-Currency Normalization បំបែកឱ្យដាច់រវាងរូបិយប័ណ្ណ KHR (៛) និង USD ($) ដោយមិនបូកច្រឡំចូលគ្នាឡើយ។

២. គំរូ JSON Extraction Prompt សម្រាប់ Invoices & Receipts

គំរូទម្រង់ JSON ដែលពេញនិយមបំផុតសម្រាប់ការរួមបញ្ចូលជាមួយប្រព័ន្ធស្វ័យប្រវត្តិ ៖

{
  "invoice_number": "INV-2026-089",
  "vendor_name": "Cambodia Tech Solutions Co., Ltd.",
  "vendor_vat_tin": "K008-902100456",
  "issue_date": "2026-08-18",
  "currency": "USD",
  "line_items": [
    { "description": "Cloud Server Hosting", "qty": 2, "unit_price": 250.00, "total": 500.00 },
    { "description": "Maintenance Support", "qty": 1, "unit_price": 300.00, "total": 300.00 }
  ],
  "subtotal": 800.00,
  "vat_10_percent": 80.00,
  "grand_total": 880.00,
  "payment_status": "UNPAID",
  "confidence_score": 0.99
}

៣. ការដោះស្រាយ Edge Cases ក្នុងការស្រង់ទិន្នន័យ (Edge Cases Mastery)

បញ្ហាដែលតែងតែជួបប្រទះពេលស្រង់ទិន្នន័យពីឯកសាររាប់រយសន្លឹក ៖

  1. ទម្រង់កាលបរិច្ឆេទចម្រុះ ៖ ឯកសារខ្លះសរសេរ 18/08/2026, ខ្លះសរសេរ Aug 18, 2026, ខ្លះសរសេរ ១៨ សីហា ២០២៦។ បង្គាប់ AI ឱ្យបម្លែងទាំងអស់ទៅជាស្តង់ដារ ISO YYYY-MM-DD
  2. ឈ្មោះក្រុមហ៊ុនមានសរសេរកាត់ ៖ ឯកសារខ្លះសរសេរ «ABC Co., Ltd» ឯកសារខ្លះសរសេរ «ABC Company Limited»។ ប្រើ Entity Resolution ដើម្បីផ្គូផ្គងឈ្មោះតែមួយ។
  3. វិក្កយបត្រមានការបញ្ចុះតម្លៃ (Discounts & Deductions) ៖ ត្រូវប្រាកដថា AI គណនាដក Discount មុនពេលបូកពន្ធ VAT ។
Infographic Structured Data Extraction
LIVE DOCUMENT LAB

សាកល្បងលំហូរការងារ Document Intelligence

READY

ជ្រើសរើសប្រភេទឯកសារ ដើម្បីមើលរបៀបដែល AI ជួយដំណើរការ ស្រង់ទិន្នន័យ និងពិនិត្យផ្ទៀងផ្ទាត់។

Vendor Invoice (PDF Scan) វិក្កយបត្រទិញសម្ភារការិយាល័យ
Doc Intelligence Parse → Ground → Verify
Structured JSON Payload Valid JSON • Subtotal $800 + VAT $80 = Total $880
លទ្ធផលគំរូ ៖ AI ស្រង់យកលេខវិក្កយបត្រ INV-089, ឈ្មោះក្រុមហ៊ុន Vendor, កាលបរិច្ឆេទ 2026-08-18, បញ្ជីទំនិញ ២ មុខ និងផ្ទៀងផ្ទាត់ផលបូក $800 + VAT 10% = $880 ត្រឹមត្រូវ ១០០% ទៅជា JSON Schema ។
Workflow Structured Data Extraction

អនុវត្តជាក់ស្តែង ៖ សាកល្បង PROMPT គំរូ

សាកអនុវត្ត • DOCUMENT PROMPT ជាភាសាខ្មែរ

សូមដើរតួជា Document Data Extraction Specialist & Schema Architect ។ ផ្អែកលើឯកសារ [បញ្ចូលវិក្កយបត្រ ឬកិច្ចសន្យា] សូមស្រង់ទិន្នន័យជាទម្រង់ JSON ស្របតាម Schema ខាងក្រោម ៖ ```json { "document_type": "string", "document_id": "string", "date": "YYYY-MM-DD", "parties": [ {"role": "buyer/seller/landlord/tenant", "name": "string", "tax_id": "string"} ], "financials": { "currency": "USD/KHR", "subtotal": 0.00, "tax_amount": 0.00, "grand_total": 0.00 }, "line_items": [ {"description": "string", "quantity": 0, "unit_price": 0.00, "total": 0.00} ], "missing_fields": ["array of fields not found in doc"], "source_page": 1 } ``` *វិធានតឹងរ៉ឹង ៖ គណនាផលបូកឡើងវិញដើម្បីផ្ទៀងផ្ទាត់។ ប្រសិនបើ field ណាគ្មានក្នុងឯកសារ សូមដាក់តម្លៃ null កុំប្រឌិតឡើយ។ ផ្តល់តែ Code JSON សុទ្ធ ដោយគ្មាន Text ផ្សេងនៅក្រៅ Codeblock ឡើយ។*

ពិនិត្យការយល់ដឹង (Knowledge Check)

QUIZ ខ្លី

តើអ្វីជាអត្ថប្រយោជន៍ចម្បងនៃការស្រង់ទិន្នន័យជាទម្រង់ Structured JSON ធៀបនឹង Plain Text?

ចម្លើយត្រឹមត្រូវ ៖ JSON ផ្តល់រចនាសម្ព័ន្ធច្បាស់លាស់ (Key-Value) ដែលអនុញ្ញាតឱ្យប្រព័ន្ធកុំព្យូទ័រ និង Database អាចអាន និងដំណើរការទិន្នន័យបន្តបានដោយស្វ័យប្រវត្តិ។

ចំណុចគន្លឹះត្រូវចងចាំក្នុងមេរៀននេះ

  • ស្រង់ទិន្នន័យតាម Schema ច្បាស់លាស់ (JSON / Table) ដើម្បីងាយស្រួលបញ្ចូលប្រព័ន្ធ ERP ។
  • អនុវត្ត Validation Rules ផ្ទៀងផ្ទាត់ផលបូក និងកាលបរិច្ឆេទមុន Export ។
  • ប្រើតម្លៃ `null` សម្រាប់ទិន្នន័យដែលគ្មានក្នុងឯកសារ ការពារការប្រឌិត។
  • ធ្វើ Normalization លើកាលបរិច្ឆេទ (YYYY-MM-DD) និងរូបិយប័ណ្ណ (KHR vs USD)។
MISSION COMPLETED

កំពុងបង្កើតជំនាញ Document Intelligence របស់អ្នក

បន្តអានគ្រប់ Checkpoint និងឆ្លើយ Quiz ដើម្បីបើក Badge និង XP របស់អ្នក។

0% • 🧾 Information Extractor បន្តមេរៀនបន្ទាប់
មេរៀនផ្សេងទៀត

មេរៀនផ្សេងទៀត

ទំព័រដើម
រៀនត្រេត
រៀន AI
ការកំណត់