Koleksi Pustaka
Sistem pencarian gambar konvensional umumnya masih bergantung pada metadata manual yang kurang mampu menangkap makna semantik visual. Pendekatan cross-modal retrieval menggunakan model CLIP menawarkan solusi, namun performanya menurun pada bahasa non-Inggris seperti Bahasa Indonesia. Penelitian ini melakukan studi komparatif terkontrol terhadap tiga konfigurasi text encoder pada arsitektur CLIP (ViT-B/32), yaitu CLIP standar (bawaan), CLIP dengan IndoBERT, dan CLIP dengan XLM-RoBERTa untuk mengevaluasi efektivitas contrastive learning berbasis Bahasa Indonesia menggunakan dataset Flickr8K dan Flickr30K Indonesia. Hasil evaluasi metrik retrieval dua arah menunjukkan bahwa CLIP standar secara konsisten mencatatkan performa tertinggi pada kedua dataset (rata-rata Recall@10 mencapai 90,52% pada Flickr8K), diikuti oleh CLIP XLM-RoBERTa, sementara CLIP IndoBERT menghasilkan performa terendah. Temuan ini membuktikan bahwa keselarasan ruang embedding (embedding space alignment) sejak fase pre-training jauh lebih mendominasi performa dibandingkan faktor spesialisasi linguistik text encoder monolingual dalam kondisi data terbatas. Model terbaik (CLIP standar) berhasil diimplementasikan ke dalam sistem Smart Gallery berbasis web menggunakan FastAPI dan NextJS. Pengujian usability menggunakan System Usability Scale (SUS) menghasilkan skor rata-rata 91,36 (kategori Excellent, Grade A), menegaskan bahwa aplikasi sangat layak dan mudah dioperasikan oleh pengguna