Structured Data Extraction
ដក Names, Dates, Amounts, Clauses និង Fields ទៅ Table ឬ JSON ដោយមាន Validation rules ។
នៅក្នុងស្ថាប័នធំៗ ការបញ្ចូលទិន្នន័យពីវិក្កយបត្ររាប់ពាន់សន្លឹក ឬទម្រង់បែបបទចុះឈ្មោះអតិថិជនទៅក្នុងប្រព័ន្ធកុំព្យូទ័រដោយដៃ (Manual Data Entry) មិនត្រឹមតែស៊ីពេលរាប់រយម៉ោងប៉ុណ្ណោះទេ ប៉ុន្តែថែមទាំងមានអត្រាកំហុសខ្ពស់ (Typo Errors)។
Structured Data Extraction គឺជាការប្រើប្រាស់ AI ដើម្បីអានឯកសារ និងស្រង់ទិន្នន័យ Key-Value Pairs ជាក់លាក់ទៅជាទម្រង់ **JSON, CSV ឬ Database Table** ស្វ័យប្រវត្តិតាម Schema ដែលបានកំណត់ទុកជាមុន។ នៅក្នុងមេរៀននេះ អ្នកនឹងរៀនពីបច្ចេកទេសស្រង់ទិន្នន័យកម្រិតខ្ពស់ដែលមាន Validation ត្រឹមត្រូវ!
គោលបំណងនៃមេរៀននេះ
ចេះរចនា JSON Schema និង Prompt សម្រាប់ស្រង់ទិន្នន័យស្មុគស្មាញពីវិក្កយបត្រ បង្កាន់ដៃ កិច្ចសន្យា និងទម្រង់បែបបទ ដោយមានវិធានផ្ទៀងផ្ទាត់ (Validation Rules) ដើម្បីការពារទិន្នន័យស្ទួន ឬលេខខុសទម្រង់ ត្រៀមបញ្ចូលទៅក្នុង Database/ERP ដោយស្វ័យប្រវត្តិ។
១. ស្ថាបត្យកម្ម Schema-Driven Extraction
ការស្រង់ទិន្នន័យត្រូវតែមាន Schema ណែនាំជាមុនដើម្បីធានាភាពថេរនៃទិន្នន័យ ៖
string (ឈ្មោះ), number/float (តម្លៃទឹកប្រាក់), date (YYYY-MM-DD), array (បញ្ជីមុខទំនិញ)។
null ឬ "N/A" ប្រសិនបើទិន្នន័យនោះមិនមានចែងក្នុងឯកសារ ហាមដាច់ខាតមិនឱ្យប្រឌិតទិន្នន័យបំពេញជំនួស។
២. គំរូ JSON Extraction Prompt សម្រាប់ Invoices & Receipts
គំរូទម្រង់ JSON ដែលពេញនិយមបំផុតសម្រាប់ការរួមបញ្ចូលជាមួយប្រព័ន្ធស្វ័យប្រវត្តិ ៖
{
"invoice_number": "INV-2026-089",
"vendor_name": "Cambodia Tech Solutions Co., Ltd.",
"vendor_vat_tin": "K008-902100456",
"issue_date": "2026-08-18",
"currency": "USD",
"line_items": [
{ "description": "Cloud Server Hosting", "qty": 2, "unit_price": 250.00, "total": 500.00 },
{ "description": "Maintenance Support", "qty": 1, "unit_price": 300.00, "total": 300.00 }
],
"subtotal": 800.00,
"vat_10_percent": 80.00,
"grand_total": 880.00,
"payment_status": "UNPAID",
"confidence_score": 0.99
}
៣. ការដោះស្រាយ Edge Cases ក្នុងការស្រង់ទិន្នន័យ (Edge Cases Mastery)
បញ្ហាដែលតែងតែជួបប្រទះពេលស្រង់ទិន្នន័យពីឯកសាររាប់រយសន្លឹក ៖
- ទម្រង់កាលបរិច្ឆេទចម្រុះ ៖ ឯកសារខ្លះសរសេរ
18/08/2026, ខ្លះសរសេរAug 18, 2026, ខ្លះសរសេរ១៨ សីហា ២០២៦។ បង្គាប់ AI ឱ្យបម្លែងទាំងអស់ទៅជាស្តង់ដារ ISOYYYY-MM-DD។ - ឈ្មោះក្រុមហ៊ុនមានសរសេរកាត់ ៖ ឯកសារខ្លះសរសេរ «ABC Co., Ltd» ឯកសារខ្លះសរសេរ «ABC Company Limited»។ ប្រើ Entity Resolution ដើម្បីផ្គូផ្គងឈ្មោះតែមួយ។
- វិក្កយបត្រមានការបញ្ចុះតម្លៃ (Discounts & Deductions) ៖ ត្រូវប្រាកដថា AI គណនាដក Discount មុនពេលបូកពន្ធ VAT ។
សាកល្បងលំហូរការងារ Document Intelligence
ជ្រើសរើសប្រភេទឯកសារ ដើម្បីមើលរបៀបដែល AI ជួយដំណើរការ ស្រង់ទិន្នន័យ និងពិនិត្យផ្ទៀងផ្ទាត់។
អនុវត្តជាក់ស្តែង ៖ សាកល្បង PROMPT គំរូ
សូមដើរតួជា Document Data Extraction Specialist & Schema Architect ។ ផ្អែកលើឯកសារ [បញ្ចូលវិក្កយបត្រ ឬកិច្ចសន្យា] សូមស្រង់ទិន្នន័យជាទម្រង់ JSON ស្របតាម Schema ខាងក្រោម ៖ ```json { "document_type": "string", "document_id": "string", "date": "YYYY-MM-DD", "parties": [ {"role": "buyer/seller/landlord/tenant", "name": "string", "tax_id": "string"} ], "financials": { "currency": "USD/KHR", "subtotal": 0.00, "tax_amount": 0.00, "grand_total": 0.00 }, "line_items": [ {"description": "string", "quantity": 0, "unit_price": 0.00, "total": 0.00} ], "missing_fields": ["array of fields not found in doc"], "source_page": 1 } ``` *វិធានតឹងរ៉ឹង ៖ គណនាផលបូកឡើងវិញដើម្បីផ្ទៀងផ្ទាត់។ ប្រសិនបើ field ណាគ្មានក្នុងឯកសារ សូមដាក់តម្លៃ null កុំប្រឌិតឡើយ។ ផ្តល់តែ Code JSON សុទ្ធ ដោយគ្មាន Text ផ្សេងនៅក្រៅ Codeblock ឡើយ។*
ពិនិត្យការយល់ដឹង (Knowledge Check)
តើអ្វីជាអត្ថប្រយោជន៍ចម្បងនៃការស្រង់ទិន្នន័យជាទម្រង់ Structured JSON ធៀបនឹង Plain Text?
ចំណុចគន្លឹះត្រូវចងចាំក្នុងមេរៀននេះ
- ស្រង់ទិន្នន័យតាម Schema ច្បាស់លាស់ (JSON / Table) ដើម្បីងាយស្រួលបញ្ចូលប្រព័ន្ធ ERP ។
- អនុវត្ត Validation Rules ផ្ទៀងផ្ទាត់ផលបូក និងកាលបរិច្ឆេទមុន Export ។
- ប្រើតម្លៃ `null` សម្រាប់ទិន្នន័យដែលគ្មានក្នុងឯកសារ ការពារការប្រឌិត។
- ធ្វើ Normalization លើកាលបរិច្ឆេទ (YYYY-MM-DD) និងរូបិយប័ណ្ណ (KHR vs USD)។
កំពុងបង្កើតជំនាញ Document Intelligence របស់អ្នក
បន្តអានគ្រប់ Checkpoint និងឆ្លើយ Quiz ដើម្បីបើក Badge និង XP របស់អ្នក។
by