PDF, DOCX និង File Preparation
រៀបឈ្មោះ File, Version, Page range និងពិនិត្យថា Text អាចអានបានមុនវិភាគ។
គោលការណ៍គ្រឹះនៃវិទ្យាសាស្ត្រកុំព្យូទ័រចែងថា «Garbage In, Garbage Out» (បើទិន្នន័យបញ្ចូលរញ៉េរញ៉ៃ លទ្ធផលចេញមកក៏រញ៉េរញ៉ៃដូចគ្នា)។ ប្រសិនបើអ្នក Upload ឯកសារ PDF ដែលមានទំព័រស្ទួន រូបភាពស្រវាំង ឬមានទំព័រផ្សាយពាណិជ្ជកម្មឥតប្រយោជន៍ជាច្រើន AI នឹងខ្ជះខ្ជាយ Context Window ហើយផ្តល់ចម្លើយដែលមិនសុក្រឹតឡើយ។
នៅក្នុងមេរៀននេះ អ្នកនឹងរៀនពីបច្ចេកទេស Pre-Processing & Document Preparation ដ៏មានប្រសិទ្ធភាព ដើម្បីធានាថា AI ទទួលបានតែទិន្នន័យស្អាត និងចំគោលដៅបំផុត។
គោលបំណងនៃមេរៀននេះ
ចេះរៀបចំឯកសារជាប្រព័ន្ធមុនពេលបញ្ជូនទៅ AI ៖ ការបែងចែក Native Digital PDF vs Scanned PDF, ការសម្អាត Noise និងទំព័រឥតប្រយោជន៍, ស្តង់ដារដាក់ឈ្មោះ File & Versioning, និងបច្ចេកទេស Chunking ឯកសារក្រាស់ៗលើសពី Context Window ។
១. ភាពខុសគ្នារវាង Native Digital PDF និង Scanned PDF
ការយល់ដឹងពីប្រភេទ PDF ជួយឱ្យអ្នកដឹងពីជំហានដែលត្រូវត្រៀម ៖
២. ស្តង់ដារដាក់ឈ្មោះ File និង Version Control
ការរៀបចំឈ្មោះឯកសារឱ្យមានស្តង់ដារ ជួយឱ្យទាំងមនុស្ស និង AI មិនច្រឡំកំណែចាស់និងថ្មី ៖
Report_final.pdf, doc_final_v2_edit_last.docx, Scan00129.pdf (គ្មានកាលបរិច្ឆេទ គ្មានប្រធានបទ គ្មានលេខកំណែច្បាស់លាស់)។
[YYYY-MM-DD]_[Project/Topic]_[DocType]_[vX.X]_[Status].pdfឧទាហរណ៍ ៖
2026-08-18_Q2-Financial-Audit_Report_v1.2_Approved.pdf
៣. បច្ចេកទេស Document Trimming & Page Range Selection
កុំ Upload ឯកសារទាំងមូលប្រសិនបើអ្នកត្រូវការតែផ្នែកខ្លះ ៖
- លុបទំព័រ Cover & Ads ឥតប្រយោជន៍ ៖ កាត់ចោលទំព័រមុខ ទំព័រផ្សាយពាណិជ្ជកម្ម និងទំព័រទទេ ដើម្បីសន្សំ Context Window ។
- បញ្ជាក់ Page Range ច្បាស់លាស់ក្នុង Prompt ៖ ប្រសិនបើ Upload ឯកសារ ៥០ ទំព័រ ប៉ុន្តែចង់វិភាគតែរបាយការណ៍ហិរញ្ញវត្ថុ សូមបញ្ជាក់ ៖ «សូមផ្តោតការវិភាគតែលើទំព័រ ២២ ដល់ ៣៥ ប៉ុណ្ណោះ»។
- បម្លែងតារាងស្មុគស្មាញទៅជា CSV/Excel ៖ ប្រសិនបើឯកសារមានតារាងទិន្នន័យធំៗ ការស្រង់តារាងនោះជា CSV នឹងផ្តល់ភាពសុក្រឹតដល់ AI ខ្ពស់ជាងការឱ្យវាអានរូបភាពតារាងក្នុង PDF ។
សាកល្បងលំហូរការងារ Document Intelligence
ជ្រើសរើសប្រភេទឯកសារ ដើម្បីមើលរបៀបដែល AI ជួយដំណើរការ ស្រង់ទិន្នន័យ និងពិនិត្យផ្ទៀងផ្ទាត់។
អនុវត្តជាក់ស្តែង ៖ សាកល្បង PROMPT គំរូ
សូមដើរតួជា Document Processing Engineer ។ ខ្ញុំបានភ្ជាប់ឯកសារ [ឈ្មោះ File ឧ. 2026-08-18_Procurement-Contract_v1.0.pdf]។ សូមជួយ ៖ ១. ពិនិត្យរចនាសម្ព័ន្ធឯកសារ ៖ តើជា Native Digital PDF ឬ Scanned Document? ២. ផ្តោតការវិភាគតែលើផ្នែក [បញ្ចូល Page Range ឧ. ទំព័រ ១០ ដល់ ១៨] ដែលនិយាយអំពី [ប្រធានបទ] ៣. ស្រង់យកតារាងទិន្នន័យក្នុងផ្នែកនោះ រៀបចំជា Markdown Table ស្អាត ៤. រាយបញ្ជីទំព័រណាខ្លះដែលខ្វះព័ត៌មាន ឬមានអក្សរស្រវាំងពិបាកអាន។
ពិនិត្យការយល់ដឹង (Knowledge Check)
តើបញ្ហាអ្វីដែលតែងតែកើតឡើងចំពោះ Scanned PDF ធៀបនឹង Native Digital PDF?
ចំណុចគន្លឹះត្រូវចងចាំក្នុងមេរៀននេះ
- បែងចែកឱ្យដាច់រវាង Native Digital PDF (មាន Text) និង Scanned PDF (ជារូបភាព ត្រូវរត់ OCR)។
- អនុវត្តស្តង់ដារដាក់ឈ្មោះឯកសារ ISO ៖ [កាលបរិច្ឆេទ]_[ប្រធានបទ]_[ប្រភេទ]_[កំណែ]។
- កាត់ទំព័រឥតប្រយោជន៍ចោល និងកំណត់ Page Range ជាក់លាក់ដើម្បីបង្កើនភាពសុក្រឹតនៃ AI ។
- ឯកសារក្រាស់ៗលើសពី ១០០ ទំព័រ ត្រូវបំបែកជា Chunks តាមជំពូកន័យ។
កំពុងបង្កើតជំនាញ Document Intelligence របស់អ្នក
បន្តអានគ្រប់ Checkpoint និងឆ្លើយ Quiz ដើម្បីបើក Badge និង XP របស់អ្នក។
by