Loading...
- Type of Document: M.Sc. Thesis
- Language: Farsi
- Document No: 58813 (19)
- University: Sharif University of Technology
- Department: Computer Engineering
- Advisor(s): Asgari, Ehsaneddin; Sharifi Zarchi, Ali
- Abstract:
- This study explores the problem of multimodal information retrieval in English and Persian, with a particular focus on electronic commerce where users often search for products using textual or visual queries. To enable multimodal retrieval in Persian, a Persian CLIP model (Contrastive Language-Image Pretraining) was trained. The training dataset was constructed from multiple sources, including machine-translated English corpora, web-crawled Persian data from the Divar platform, and user search and click logs from the Torob marketplace. After filtering and quality evaluation, the model successfully learned a shared embedding space between Persian text and images, forming the foundation for a practical multimodal retrieval system. In the next stage, an intelligent multi-agent system was developed to combine similarity-based retrieval with analytical reasoning, enabling natural, conversational interaction with users. Experimental results show that the Persian CLIP model outperforms the original English CLIP (ACC@1 = 0.25 vs. 0.04), and the multi-agent system achieves the best overall performance with ACC@1 = 0.78. These findings demonstrate that combining multimodal models with intelligent agents can significantly enhance user experience and retrieval accuracy in Persian-language search systems
- Keywords:
- Multimodal Information Retrieval ; Electronic Commerce ; Intelligent Multi-Agent System ; Contrastive Language–Image Pretraining (CLIP) Model ; Localized Dataset
-
محتواي کتاب
- view
- مقدمه
- تعریف مسئله
- اهمیت موضوع
- ادبیات موضوع
- مروری بر بازیابی اطلاعات متنی
- یادگیری عمیق در بازیابی متنی
- بازیابی اطلاعات چندوجهی
- مدلهای چندزبانه و میانزبانی
- دادگان متن و تصویر و مقیاس
- نمایهسازی برداری و سنجههای ارزیابی
- عاملهای هوشمند در بازیابی و تعامل
- اهداف پژوهش
- دستاوردهای پژوهش
- ساختار پایاننامه
- کارهای پیشین
- سیر تحول بازیابی اطلاعات متنی
- مبانی کلاسیک: از مدلهای بولی تا رویکردهای آماری
- مدلهای عصبی در بازیابی اطلاعات
- رتبهبندی مبتنی بر ترنسفورمرها: دقت در برابر سرعت
- رمزگشاها و مدلهای مولد در رتبهبندی و تعامل
- بازیابی اطلاعات چندوجهی
- یادگیری بازنمایی مشترک و CLIP
- همخانوادههای CLIP و مسیر تکامل
- بازیابی اطلاعات چندزبانه و چالشهای زبان فارسی
- رویکردهای بازیابی چندزبانه
- مورد کاوی زبان فارسی: شکاف داده و مدل
- زیرساختهای فنی سیستمهای بازیابی مدرن
- دادگانهای بزرگ و مسئلهی مقیاس در برابر کیفیت
- نمایهسازی برداری و جستوجوی تقریبی نزدیکترین همسایه (ANN)
- عاملهای هوشمند: از جستوجوی تعاملی تا حل مسئله
- تولید تقویتشده با بازیابی
- عاملهای هوشمند برای بازیابی اطلاعات
- سنجههای ارزیابی و جمعبندی
- نتیجهگیری
- سیر تحول بازیابی اطلاعات متنی
- روش تحقیق
- دادگان
- نیازمندیها و ملاحظات کلی
- ترجمهی دادگان انگلیسی به فارسی
- خزش از وبسایت دیوار
- دادگان محصولات و تعامل کاربران در ترب
- محدودیتها و سوگیریهای بالقوه
- جمعبندی
- ارزیابی
- ارزیابی مدلهای چندوجهی
- ارزیابی الگوریتم نهایی بازیابی اطلاعات
- ارزیابی تطبیقی روی دادههای واقعی ترب
- جمعبندی
- آموزش مدل چندوجهی
- مرحلهی آموزش و تعریف تابع هزینه
- ورودی و پردازش دادهها
- نگهداری و انتشار مدل
- عاملهای هوشمند
- نمای کلی معماری
- عاملها و نقشها
- جمعبندی
- دادگان
- نتایج جدید
- مرور کلی دستاوردها
- نتایج ارزیابی مدل
- نتایج روی دادگان Flickr30k
- نتایج روی دادگان nocaps
- بحث مقایسهای و نکتههای تکمیلی
- ارزیابی برونخط بر روی لاگهای «ترب»
- نتایج مربوط به عاملهای هوشمند
- مقایسهی دقت
- زمان پاسخگویی
- جمعبندی
- تحلیل خطاها و حساسیتها
- جمعبندی
- نتیجهگیری
- جمعبندی دستاوردها
- پاسخ به پرسشهای پژوهش
- محدودیتها
- مسائل باز
- پیشنهادهایی برای ادامهی کار
- سخن پایانی
- مراجع
- واژهنامه
