Koleksi Pustaka
Dokumen administratif merupakan salah satu sumber informasi penting yang digunakan dalam berbagai aktivitas organisasi dan institusi. Namun, proses identifikasi informasi penting pada dokumen administratif masih banyak dilakukan secara manual sehingga membutuhkan waktu yang cukup lama dan berpotensi menimbulkan kesalahan. Penelitian ini bertujuan mengembangkan sistem analisis dokumen administratif yang mampu melakukan ekstraksi informasi penting dan menghasilkan ringkasan dokumen secara otomatis. Sistem yang dikembangkan memanfaatkan PaddleOCR untuk mengekstraksi teks dari dokumen PDF digital, PDF hasil pemindaian, dan DOCX, serta model IndoBERT yang telah melalui proses fine-tuning untuk melakukan Named Entity Recognition (NER) terhadap entitas administratif seperti nomor surat, jenis dokumen, tanggal, pengirim, penerima, perihal, lokasi, waktu, dan isi dokumen. Selain itu, sistem mengimplementasikan LayoutLMv3 untuk mendukung ekstraksi informasi pada dokumen yang mengandung tabel dan menghasilkan ringkasan dokumen berdasarkan hasil identifikasi entitas. Model NER dilatih melalui 13 skenario eksperimen dengan berbagai strategi optimasi, dan konfigurasi terbaik diperoleh pada Run ID #13 dengan nilai F1-score sebesar 88,56%. Sistem kemudian diimplementasikan dalam bentuk REST API menggunakan FastAPI dan di-deploy pada AWS EC2. Hasil pengujian menunjukkan bahwa sistem mampu mengidentifikasi informasi penting secara otomatis dan menghasilkan ringkasan dokumen yang relevan, sehingga dapat membantu meningkatkan efisiensi pengelolaan dan analisis dokumen administratif