[Vision Language Model]
Summary
[X:AI Conference]
2024.08 ~ 2024.11
Project Link: Github
- 입력 이미지에 **Segmentation Module(SAM)**을 추가해 모델이 이미지 속 필요한 부분만 활용할 수 있도록 전처리
- 기존 Projection Module을 Q-Former를 응용한 형태 변환하여 Text-Image alignment 향상 (✨)
- COCO Segmentation Benchmark 실험 결과 33.2%로 비공식 1위 달성 (Papers with code 기준)
- ❓About this project
1. Introduction
주제 Task 설명
2. Related Work
Supervised Composed Image Retrieval
Zero-shot Composed Image Retrieval
3. IDEA
기존 모델들의 한계점
Main IDEA
4. Training
Dataset
Training Flow
5. Experiments
ImageNet-S