갑자기 회사에서 내년 사업에 VLM을 활용한 사업군을 준비한다고 하여 급하게 준비하고 공부하는 중이다.(1년만에 쓰게 되어 부끄러움)먼저 VLM 모델은 시각 + 언어를 동시에 이해하고 연결할 수 있는 모델이다. 쉽게 설명하자면 눈도 있고 말도 할 줄 안다고 생각하면 될 듯. 특징멀티모달(Multi-modal) 학습텍스트와 이미지를 같은 임베딩 공간으로 매핑텍스트-이미지 매칭텍스트 설명과 이미지가 서로 잘 맞는지 구분 가능이미지 캡션 생성이미지를 보고 자동으로 문장을 만들어냄시각적 질의응답(Visual Question Answering, VQA)이미지를 주고 질문하면 텍스트로 답변Zero-Shot 기능추가 학습 없이도 새로운 이미지/객체 잘 동작임베딩 공간(embeding space): 데이터(텍스트, 이..