Vision Langunage Model
비전 언어 모델(VLM)은 컴퓨팅 비전과 자연어 처리(NLP) 기능을 결합한 인공 지능(AI) 모델입니다.
About
VLM은 텍스트 데이터와 이미지 또는 동영상과 같은 시각적 데이터 간의 관계를 매핑하는 방법을 학습하여, 시각적 입력에서 텍스트를 생성하거나 시각적 정보의 맥락에서 자연어 프롬프트를 이해할 수 있습니다.
시각적 언어 모델이라고도 하는 VLM은 대규모 언어 모델(LLM)과 비전 모델 또는 시각적 머신 러닝(ML) 알고리즘을 결합한 것입니다.
멀티모달 AI 시스템인 VLM은 텍스트와 이미지 또는 동영상을 입력으로 받아 일반적으로 이미지 또는 동영상 설명의 형태로 텍스트를 출력하여 이미지에 대한 질문에 답하거나 동영상에서 이미지 또는 객체의 일부를 식별합니다.
비전 언어 모델의 요소
비전 언어 모델은 일반적으로 다음과 같은 두 가지 주요 구성 요소로 구성됩니다.
- 언어 인코더
- 비전 인코더
언어 인코더
언어 인코더는 단어와 구문 간의 의미적 의미와 문맥적 연관성을 포착하여 AI 모델이 처리할 수 있는 텍스트 임베딩으로 변환합니다.
대부분의 VLM은 언어 인코더에 트랜스포머 모델로 알려진 신경망 아키텍처를 사용합니다. 트랜스포머의 예로는 오늘날 많은 LLM의 기반이 된 최초의 파운데이션 모델 중 하나인 Google의 BERT(트랜스포머의 양방향 인코더 표현)와 OpenAI의 GPT(생성형 사전 학습 트랜스포머) 등이 있습니다.
다음은 트랜스포머 아키텍처에 대한 간략한 개요입니다.
- 인코더는 입력 시퀀스를 임베딩이라는 수치적 표현으로 변환하며, 이 임베딩은 입력 시퀀스 내 토큰의 의미와 위치를 담고 있습니다.
- 셀프 어텐션 메커니즘을 통해 트랜스포머는 위치에 관계 없이 입력 시퀀스에서 가장 중요한 토큰에 '주의를 집중'할 수 있습니다.
- 디코더는 이 셀프 어텐션 메커니즘과 인코더의 임베딩을 사용하여 통계적으로 가장 확률이 높은 아웃풋 시퀀스를 생성합니다.
비전 인코더
비전 인코더는 이미지 또는 동영상 입력에서 색상, 모양, 텍스처와 같은 중요한 시각적 속성을 추출하여 머신러닝 모델이 처리할 수 있는 벡터 임베딩으로 변환합니다.
이전 버전의 VLM은 특징 추출을 위해 컴볼루션 신경망과 같은 딥 러닝 알고리즘을 사용했습니다. 최신 비전 언어 모델에서는 트랜스포머 기반 언어 모델의 요소를 적용하는 비전 트랜스포머(ViT)를 사용합니다.
ViT는 이미지를 패치로 처리하고 언어 변환기의 토큰처럼 시퀀스로 처리합니다. 그런 다음 비전 트랜스포머는 이러한 패치에서 셀프 어텐션을 구현하여 입력 이미지의 트랜스포머 기반 표현을 생성합니다.