Back to All Projects
Featured Project

Multimodal Semantic Search for Fashion

Multimodal search system combining text and image queries over 20K+ fashion products using vector similarity and cosine ranking.

OpenAIGroqMetaCLIPBLIPChromaDBTesseract OCRPandasNumPyPython

Detailed Overview

A sophisticated recommendation system that enables users to search 20,000+ fashion products using both text descriptions and image queries. Combines MetaCLIP for visual embeddings, BLIP for image captioning, ChromaDB for vector storage, and Groq-powered LLM for natural language understanding.

Problem Statement

Traditional fashion search relies only on keywords or filters, missing the semantic intent behind queries. Users cannot search by image similarity or combined text+image queries.

Technical Solution

Built a multimodal pipeline using MetaCLIP for visual embeddings and BLIP for image captioning, storing vectors in ChromaDB. Users can query with text, image, or both, with cosine similarity ranking returning the most semantically relevant results.

Architecture & Data Flow

Product catalog → BLIP captioning + MetaCLIP visual embedding → ChromaDB vector store → Query (text/image/both) → Embedding → Cosine similarity search → Ranked results + Groq LLM explanation