본 프로젝트는 7기 TVING 기업 연계 프로젝트로,
자연어를 활용한 동영상 속 특정 장면 검색을 목표로 하는 Video Retrieval 프로젝트 입니다.
기존 메타데이터(제목, 태그, 키워드) 기반의 영상 검색 방식은 영상 구간별 검색이 불가하다는 한계를 해결하고자, 본 프로젝트는 장면별 텍스트 변환(V2T, Video-to-Text) 과 텍스트 기반 장면 검색 기능(T2V , Text-to-Video) 을 통해 사용자가 원하는 특정 장면 검색이 가능하도록 하였습니다.
- 동영상을 장면 기준으로 자동 분할하고, 장면 별 설명문을 생성하여 저장합니다.
- 사용자가 입력한 자연어 쿼리를 기반으로, 가장 적절한 장면을 검색하여 제공합니다.
- 영상 속 대사(Speech-to-Text) 및 장면 설명을 활용하여 더욱 정교한 검색을 수행합니다.
💡특징
✅ 빠른 검색을 위해 Vector DB 사용 및 병렬 MSA(Micro Service Architecture) 패턴 적용
✅ 최신 멀티모달 AI 모델(IntrenVL2.5, InternVideo2.5 등)과 Whisper STT, Vector DB 등 최신 기술 채용
✅ 영상 내 Speech 정보 + 전체 영상 summary + 장면 캡션의 결합(Cap fusion)으로 검색 정확도 향상
✅ MLLM의 Hallucination 문제 해결을 위한 자체 정성 평가 체크리스트 및 Prompt Engineering 수행










