មេរៀនទី៤
DOCUMENT INTELLIGENCE • LESSON ៤

PDF, DOCX និង File Preparation

Sot Dimong by Sot Dimong
១៨ សីហា ២០២៦

រៀបឈ្មោះ File, Version, Page range និងពិនិត្យថា Text អាចអានបានមុនវិភាគ។

រយៈពេលប្រហែល ១៥ នាទី
Document Mission • Level 1 📄 Document Starter 0 XP
ចាប់ផ្តើម
PDF, DOCX និង File Preparation
សេចក្តីផ្តើម
គោលការណ៍គ្រឹះនៃវិទ្យាសាស្ត្រកុំព្យូទ័រចែងថា «Garbage In, Garbage Out» (បើទិន្នន័យបញ្ចូលរញ៉េរញ៉ៃ លទ្ធផលចេញមកក៏រញ៉េរញ៉ៃដូចគ្នា)។ ប្រសិនបើអ្នក Upload ឯកសារ PDF ដែលមានទំព័រស្ទួន រូបភាពស្រវាំង ឬមានទំព័រផ្សាយពាណិជ្ជកម្មឥតប្រយោជន៍ជាច្រើន AI នឹងខ្ជះខ្ជាយ Context Window ហើយផ្តល់ចម្លើយដែលមិនសុក្រឹតឡើយ។

នៅក្នុងមេរៀននេះ អ្នកនឹងរៀនពីបច្ចេកទេស Pre-Processing & Document Preparation ដ៏មានប្រសិទ្ធភាព ដើម្បីធានាថា AI ទទួលបានតែទិន្នន័យស្អាត និងចំគោលដៅបំផុត។

គោលបំណងនៃមេរៀននេះ

ចេះរៀបចំឯកសារជាប្រព័ន្ធមុនពេលបញ្ជូនទៅ AI ៖ ការបែងចែក Native Digital PDF vs Scanned PDF, ការសម្អាត Noise និងទំព័រឥតប្រយោជន៍, ស្តង់ដារដាក់ឈ្មោះ File & Versioning, និងបច្ចេកទេស Chunking ឯកសារក្រាស់ៗលើសពី Context Window ។

១. ភាពខុសគ្នារវាង Native Digital PDF និង Scanned PDF

ការយល់ដឹងពីប្រភេទ PDF ជួយឱ្យអ្នកដឹងពីជំហានដែលត្រូវត្រៀម ៖

១. Native Digital PDF (បង្កើតចេញពី Word/InDesign) មាន Text Layer ផ្ទាល់ក្នុងកូដឯកសារ។ អ្នកអាច Select, Copy និង Search អក្សរបានភ្លាមៗ។ គុណសម្បត្តិ ៖ AI អាចអានបានលឿន និងត្រឹមត្រូវ ១០០% ។
២. Scanned Image PDF (រូបថតស្កេនពីក្រដាស) គ្មាន Text Layer ទេ វាគ្រាន់តែជារូបភាពប៉ុណ្ណោះ។ មិនអាច Select ឬ Search អក្សរបានឡើយ។ ដំណោះស្រាយ ៖ ត្រូវដំណើរការ Optical Character Recognition (OCR) ជាមុនសិន។
៣. Multi-Column & Complex Layouts ឯកសារដែលមាន Layout ច្រើនជួរ (កាសែត ទស្សនាវដ្តី) អាចធ្វើឱ្យ AI អានច្រឡំលំដាប់បន្ទាត់។ ដំណោះស្រាយ ៖ បម្លែងទៅជា Markdown ឬ Plain Text មុន Upload ។
៤. Large Documents (> 100 Pages) ឯកសារក្រាស់ពេកអាចស៊ី Memory និងធ្វើឱ្យ AI ភ្លេចព័ត៌មាននៅកណ្តាល (Lost in the Middle)។ ដំណោះស្រាយ ៖ កាត់ជាជំពូកតូចៗ (Chunking)។

២. ស្តង់ដារដាក់ឈ្មោះ File និង Version Control

ការរៀបចំឈ្មោះឯកសារឱ្យមានស្តង់ដារ ជួយឱ្យទាំងមនុស្ស និង AI មិនច្រឡំកំណែចាស់និងថ្មី ៖

ឈ្មោះមិនត្រឹមត្រូវ (Bad Practices) Report_final.pdf, doc_final_v2_edit_last.docx, Scan00129.pdf (គ្មានកាលបរិច្ឆេទ គ្មានប្រធានបទ គ្មានលេខកំណែច្បាស់លាស់)។
ស្តង់ដារដាក់ឈ្មោះត្រឹមត្រូវ (ISO Standard Convention) [YYYY-MM-DD]_[Project/Topic]_[DocType]_[vX.X]_[Status].pdf
ឧទាហរណ៍ ៖ 2026-08-18_Q2-Financial-Audit_Report_v1.2_Approved.pdf

៣. បច្ចេកទេស Document Trimming & Page Range Selection

កុំ Upload ឯកសារទាំងមូលប្រសិនបើអ្នកត្រូវការតែផ្នែកខ្លះ ៖

  1. លុបទំព័រ Cover & Ads ឥតប្រយោជន៍ ៖ កាត់ចោលទំព័រមុខ ទំព័រផ្សាយពាណិជ្ជកម្ម និងទំព័រទទេ ដើម្បីសន្សំ Context Window ។
  2. បញ្ជាក់ Page Range ច្បាស់លាស់ក្នុង Prompt ៖ ប្រសិនបើ Upload ឯកសារ ៥០ ទំព័រ ប៉ុន្តែចង់វិភាគតែរបាយការណ៍ហិរញ្ញវត្ថុ សូមបញ្ជាក់ ៖ «សូមផ្តោតការវិភាគតែលើទំព័រ ២២ ដល់ ៣៥ ប៉ុណ្ណោះ»។
  3. បម្លែងតារាងស្មុគស្មាញទៅជា CSV/Excel ៖ ប្រសិនបើឯកសារមានតារាងទិន្នន័យធំៗ ការស្រង់តារាងនោះជា CSV នឹងផ្តល់ភាពសុក្រឹតដល់ AI ខ្ពស់ជាងការឱ្យវាអានរូបភាពតារាងក្នុង PDF ។
Infographic PDF, DOCX និង File Preparation
LIVE DOCUMENT LAB

សាកល្បងលំហូរការងារ Document Intelligence

READY

ជ្រើសរើសប្រភេទឯកសារ ដើម្បីមើលរបៀបដែល AI ជួយដំណើរការ ស្រង់ទិន្នន័យ និងពិនិត្យផ្ទៀងផ្ទាត់។

Scanned Contract (Image Only) PDF ស្កេនពីក្រដាស គ្មាន Text Layer
Doc Intelligence Parse → Ground → Verify
Pre-Processed OCR + Clean Text OCR Run → Text Layer Embedded → Searchable
លទ្ធផលគំរូ ៖ ប្រព័ន្ធសម្គាល់ឃើញថាជា Scanned Image រួចដំណើរការ OCR បង្កើត Text Layer ធ្វើឱ្យឯកសារអាច Select, Copy, និង Search បាន ១០០% មុនបញ្ជូនទៅ LLM ។
Workflow PDF, DOCX និង File Preparation

អនុវត្តជាក់ស្តែង ៖ សាកល្បង PROMPT គំរូ

សាកអនុវត្ត • DOCUMENT PROMPT ជាភាសាខ្មែរ

សូមដើរតួជា Document Processing Engineer ។ ខ្ញុំបានភ្ជាប់ឯកសារ [ឈ្មោះ File ឧ. 2026-08-18_Procurement-Contract_v1.0.pdf]។ សូមជួយ ៖ ១. ពិនិត្យរចនាសម្ព័ន្ធឯកសារ ៖ តើជា Native Digital PDF ឬ Scanned Document? ២. ផ្តោតការវិភាគតែលើផ្នែក [បញ្ចូល Page Range ឧ. ទំព័រ ១០ ដល់ ១៨] ដែលនិយាយអំពី [ប្រធានបទ] ៣. ស្រង់យកតារាងទិន្នន័យក្នុងផ្នែកនោះ រៀបចំជា Markdown Table ស្អាត ៤. រាយបញ្ជីទំព័រណាខ្លះដែលខ្វះព័ត៌មាន ឬមានអក្សរស្រវាំងពិបាកអាន។

ពិនិត្យការយល់ដឹង (Knowledge Check)

QUIZ ខ្លី

តើបញ្ហាអ្វីដែលតែងតែកើតឡើងចំពោះ Scanned PDF ធៀបនឹង Native Digital PDF?

ចម្លើយត្រឹមត្រូវ ៖ Scanned PDF មិនមានអក្សរឌីជីថលពិតប្រាកដទេ វាទាមទារឱ្យមានបច្ចេកវិទ្យា OCR ដើម្បីបម្លែងរូបភាពទៅជាអត្ថបទ Text ជាមុន។

ចំណុចគន្លឹះត្រូវចងចាំក្នុងមេរៀននេះ

  • បែងចែកឱ្យដាច់រវាង Native Digital PDF (មាន Text) និង Scanned PDF (ជារូបភាព ត្រូវរត់ OCR)។
  • អនុវត្តស្តង់ដារដាក់ឈ្មោះឯកសារ ISO ៖ [កាលបរិច្ឆេទ]_[ប្រធានបទ]_[ប្រភេទ]_[កំណែ]។
  • កាត់ទំព័រឥតប្រយោជន៍ចោល និងកំណត់ Page Range ជាក់លាក់ដើម្បីបង្កើនភាពសុក្រឹតនៃ AI ។
  • ឯកសារក្រាស់ៗលើសពី ១០០ ទំព័រ ត្រូវបំបែកជា Chunks តាមជំពូកន័យ។
MISSION COMPLETED

កំពុងបង្កើតជំនាញ Document Intelligence របស់អ្នក

បន្តអានគ្រប់ Checkpoint និងឆ្លើយ Quiz ដើម្បីបើក Badge និង XP របស់អ្នក។

មេរៀនផ្សេងទៀត

មេរៀនផ្សេងទៀត

ទំព័រដើម
រៀនត្រេត
រៀន AI
ការកំណត់