벡터 데이터베이스란 무엇인가

벡터 데이터베이스(Vector Database)는 텍스트, 이미지 같은 데이터를 임베딩 모델로 바꾼 고차원 숫자 배열(벡터)을 저장하고, 질의 벡터와 가장 가까운 항목을 유사도로 찾아 주는 데이터베이스다.

Elastic은 “고차원 벡터 임베딩을 저장, 관리, 검색하여 의미 유사성 검색을 가능하게 하는 특수한 데이터베이스”로 정의하고 (Elastic, 벡터 데이터베이스란 무엇인가?), 구글 클라우드는 “벡터 임베딩을 저장, 색인 생성, 쿼리할 수 있게 해주는 모든 데이터베이스”로 넓게 잡는다 (Google Cloud, 벡터 데이터베이스란 무엇인가요?).

기존 데이터베이스가 “smartphone”과 정확히 일치하는 행을 찾는다면, 벡터 데이터베이스는 “휴대폰”이나 “모바일 디바이스”처럼 뜻이 가까운 항목까지 돌려준다 (IBM, 벡터 데이터베이스란 무엇인가요?). 검색 자체의 원리는 벡터 검색 문서에, 벡터를 만드는 과정은 임베딩 문서에 정리했다.

벡터 데이터베이스는 어떻게 작동하는가?

저장, 인덱싱, 검색 세 단계로 돈다. 데이터를 임베딩 벡터로 바꿔 저장하고, 가까운 벡터끼리 묶이도록 인덱스를 만든 뒤, 질의 벡터와 가장 가까운 k개를 근사 최근접 이웃(ANN) 알고리즘으로 찾는다 (IBM, 위 인용).

구글 클라우드는 벡터에 “단일 논리 순서가 없기 때문에” 텍스트나 숫자 필드와 다른 색인 전략이 필요하며, 모든 벡터와 정확한 거리를 재는 대신 ANN으로 “약간의 정확도(재현율)를 절충하여 검색 속도를 크게 개선”한다고 설명한다 (Google Cloud, 위 인용). 거리는 코사인 유사도, 내적, 유클리드 거리로 잰다.

인덱스 방식원리특징
HNSW여러 층의 근접 그래프. 위층은 먼 연결, 아래층은 촘촘한 연결검색 시간이 로그 규모로 늘어 대부분의 벤치마크 상위 (Malkov, Yashunin)
IVF (Inverted File)벡터를 클러스터로 나누고 가까운 클러스터만 탐색클러스터 수와 탐색 범위로 속도와 정확도 조절
PQ (Product Quantization)벡터를 짧은 코드로 압축메모리 절감, 정확도 일부 손실
LSH (Locality Sensitive Hashing)해시 함수로 비슷한 벡터를 같은 버킷에구현 단순, 정확도는 낮은 편

위키백과는 이 네 가지가 벡터 검색 시스템의 핵심 기법이며 서로 조합해 쓴다고 정리한다 (Wikipedia, Vector database). 메타의 Faiss 라이브러리는 이런 인덱스 방식들을 “벡터를 검색, 군집, 압축, 변환하는 도구 모음”으로 제공하며 벡터 데이터베이스의 핵심 기능을 담당한다 (Douze 외, The Faiss library).

실무에서는 벡터 유사도에 메타데이터 필터를 얹는다. 구글 클라우드는 “마음을 따뜻하게 하는 물고기 이야기”와 비슷한 책을 벡터로 찾으면서 “20달러 미만”으로 결과를 제한하는 하이브리드 쿼리를 예로 든다 (Google Cloud, 위 인용).

기존 데이터베이스와 무엇이 다른가?

찾는 방식이 다르다. 관계형 데이터베이스는 정확히 일치하는 값을 SQL로 찾고, 벡터 데이터베이스는 벡터 공간에서 거리가 가까운 것을 찾는다.

항목관계형 데이터베이스벡터 데이터베이스
데이터 형태행과 열의 정형 데이터고차원 벡터(임베딩)와 메타데이터
질의 방식정확한 일치, 범위 조건유사도 기반 최근접 이웃
결과조건에 맞는 행 전부가장 가까운 k개, 근사값 허용
주 용도거래 처리, 집계시맨틱 검색, RAG, 추천

마이크로소프트는 기존 데이터베이스가 “이미지와 오디오 같은 비정형 데이터”를 다루기 어려운 반면 벡터 데이터베이스는 의미 기반 검색에 맞춰 설계됐다고 설명한다 (Microsoft Azure, 벡터 데이터베이스란 무엇인가요?).

다만 둘은 합쳐지는 중이다. 구글 클라우드는 “앞으로 모든 데이터베이스가 벡터 데이터베이스가 될 것”이라고 보고 AlloyDB, Spanner, BigQuery에 벡터 기능을 넣었다 (Google Cloud, 위 인용).

PostgreSQL 확장 pgvector는 HNSW와 IVFFlat 인덱스, 코사인과 내적 등 6가지 거리 함수를 지원하고 최대 16,000차원을 저장한다 (pgvector, GitHub).

벡터 데이터베이스에는 어떤 종류가 있는가?

전용 제품, 기존 데이터베이스의 확장, 검색엔진, 클라우드 관리형 서비스 네 갈래다. IBM은 독립형 상용 제품(Pinecone), 오픈소스(Weaviate, Milvus), 데이터베이스 확장(pgvector), 벡터를 지원하는 검색엔진(OpenSearch)으로 나눈다 (IBM, 위 인용).

유형예맞는 상황
전용 벡터 DBPinecone, Milvus, Qdrant, Weaviate, Chroma벡터가 주 데이터이고 규모가 클 때
기존 DB 확장pgvector(PostgreSQL), MongoDB Atlas, Oracle이미 쓰는 DB에 벡터 검색을 더할 때
검색엔진Elasticsearch, OpenSearch, Vespa키워드 검색과 벡터 검색을 함께 쓸 때
클라우드 관리형AlloyDB, Vertex AI Vector Search, Amazon OpenSearch Service인프라 운영 없이 쓸 때

DB-Engines의 2026년 9월 벡터 DBMS 순위에는 26개 시스템이 올라 있다. 1위는 Elasticsearch(95.50점), 2위 OpenSearch(22.11), 이어 Couchbase, Pinecone(9.07), Kdb, Milvus(6.85), Qdrant(6.82) 순이고 순수 벡터 전용 제품 중 최상위는 Pinecone이다 (DB-Engines, Vector DBMS ranking).

위키백과는 40여 개 구현을 라이선스별로 정리한다. Chroma, Milvus, Qdrant, OpenSearch는 Apache 2.0, Weaviate는 BSD, pgvector는 PostgreSQL 라이선스이고 Pinecone, Elasticsearch, MongoDB Atlas는 상용이다 (Wikipedia, 위 인용).

벡터 데이터베이스는 어디에 쓰이는가?

가장 큰 용도는 RAG다. Databricks가 2025년 11월에 낸 기업 AI 현황 보고서는 RAG 애플리케이션을 떠받치는 벡터 데이터베이스 카테고리가 “전년 대비 377% 성장해 LLM 관련 기술 중 가장 빠르게” 늘었다고 밝혔다 (Databricks, State of AI: Enterprise Adoption and Growth Trends).

RAG의 원형이 된 2020년 논문은 위키백과 전체를 밀집 벡터 색인으로 만들어 사전 학습된 검색기로 접근했다 (Lewis 외, Retrieval-Augmented Generation). 구글 클라우드는 이 방식이 할루시네이션을 줄이고 “AI 기반 지원 에이전트, 법률 문서 분석기, 내부 지식 관리 시스템”에 필수라고 적는다 (Google Cloud, 위 인용).

그 밖의 용도는 다음과 같다.

  1. 추천 시스템. 사용자와 상품을 같은 벡터 공간에 두고 가까운 상품을 추천한다 (IBM, 위 인용).
  2. 이미지와 멀티모달 검색. 사진을 벡터로 바꿔 비슷한 이미지를 찾는다 (Elastic, 위 인용).
  3. 이상 탐지와 사기 탐지. 정상 패턴 벡터에서 멀리 떨어진 거래를 찾는다 (Databricks, 벡터 데이터베이스란?).
  4. 대화형 AI. 이전 대화와 문서를 벡터로 저장해 챗봇의 장기 기억으로 쓴다 (IBM, 위 인용).

벡터 인덱스와 벡터 데이터베이스는 무엇이 다른가?

인덱스는 자료 구조이고 데이터베이스는 그 위에 운영 기능을 얹은 시스템이다. Databricks는 벡터 인덱스를 “빠른 유사도 검색을 용이하게 하도록 설계된 특화된 데이터 구조”로, 벡터 데이터베이스를 “데이터 저장, CRUD 작업, 메타데이터 필터링, 수평적 확장” 기능까지 갖춘 종합 솔루션으로 구분한다 (Databricks, 벡터 데이터베이스란?, 위 인용).

Faiss나 hnswlib 같은 라이브러리만으로도 검색은 된다. AWS는 그 위에 “데이터 관리, 내결함성, 인증 및 액세스 제어, 쿼리 엔진”을 붙여 임베딩 모델을 운영 환경에 올리는 것이 벡터 데이터베이스의 역할이라고 설명한다 (AWS, 벡터 데이터베이스란?).

알고리즘 성능은 ANN-Benchmarks에서 비교할 수 있다. hnswlib, faiss, annoy, pgvector, qdrant, weaviate 등을 glove-100, sift-128 같은 공개 데이터셋에서 재현율 대비 초당 질의 수로 견준다 (ANN-Benchmarks).

벡터 데이터베이스는 어떻게 고르는가?

규모, 지연 시간, 비용, 기존 스택과의 통합 네 가지를 먼저 본다. 국내 실무 비교 글은 여기에 인덱스 종류, 하이브리드 검색, 역할 기반 접근 제어(RBAC), 커뮤니티를 더해 Pinecone, Milvus, Weaviate, Qdrant, Chroma, Elasticsearch, pgvector 7종을 견줬다 (DATA COOKBOOK, 벡터 데이터베이스 선택시 고려사항).

저장 비용도 계산해야 한다. Elastic 문서에 따르면 384차원 벡터 하나가 약 1.5KB이고, 1억 문서 인덱스에 벡터 필드를 하나 넣으면 크기가 7배가 되며, 압축 기법으로 메모리를 최대 32배 줄일 수 있다 (Elastic, 위 인용).

작게 시작해도 된다. 이미 PostgreSQL을 쓰면 pgvector로 시작하고, 키워드 검색과 섞어야 하면 Elasticsearch나 OpenSearch의 하이브리드 검색을 쓰며, 벡터 수가 수억 개로 커질 때 전용 제품을 검토하는 순서가 일반적이다.

한국에서 벡터 데이터베이스는 얼마나 검색되는가?

구글 키워드 플래너 기준 “벡터 데이터베이스”는 월 평균 390회이고 2026년 8월 1,300회로 급증했다 (서치폴라리스, 구글 키워드 플래너 2026-09-29 조회). 영문 “vector database”와 “vector db”는 각 1,600회, “벡터 db”는 1,300회로 줄임말 검색이 더 많다.

네이버 검색광고 기준 “벡터DB”는 PC 70회, 모바일 150회이고 “벡터데이터베이스”는 30회와 20회다. 구글 자동완성은 구축, 설계와 구축, 란, 종류, 비교, rag, 추천, 논문 순이고 관련 검색어에 추천, 종류, 예시, 설계, 구조, 사용법, 오픈소스가 있다.

구글 1페이지 9건 중 6건이 IBM, Elastic, Databricks, AWS, 구글 클라우드, 마이크로소프트의 벤더 용어집이었고, 9건 전원이 정의와 작동 원리를, 과반이 기존 DB와의 비교와 사용 사례를, 4건이 종류와 선택 기준을 다뤘다. 이 문서는 자동완성의 종류, 비교, 추천 수요에 맞춰 유형 표와 선택 기준을 넣었다.

벡터 데이터베이스에 대해 자주 묻는 질문은 무엇인가?

이미지와 텍스트 데이터를 저장하는 벡터DB란?

텍스트, 이미지, 오디오를 임베딩 모델로 숫자 벡터로 바꿔 저장하고 비슷한 것을 찾아 주는 데이터베이스다. 원본 파일이 아니라 의미를 담은 벡터와 메타데이터를 저장한다.

벡터 데이터베이스 종류에는 무엇이 있는가?

전용 제품(Pinecone, Milvus, Qdrant, Weaviate, Chroma), 기존 DB 확장(pgvector), 검색엔진(Elasticsearch, OpenSearch), 클라우드 관리형(AlloyDB, Amazon OpenSearch Service) 네 갈래다.

벡터 데이터베이스 오픈소스 추천은 무엇인가?

Milvus, Qdrant, Weaviate, Chroma가 오픈소스 전용 제품이고 pgvector는 PostgreSQL 확장이다. DB-Engines 순위에서는 Milvus와 Qdrant가 전용 오픈소스 중 상위다.

RAG에 벡터 데이터베이스가 꼭 필요한가?

문서가 적으면 인메모리 인덱스나 컨텍스트 윈도우에 직접 넣어도 된다. 문서가 많거나 갱신이 잦고 필터링이 필요할 때 벡터 데이터베이스가 필요하다.

벡터 데이터베이스와 그래프 데이터베이스는 무엇이 다른가?

벡터 데이터베이스는 데이터를 벡터 공간의 점으로 두고 거리로 찾고, 그래프 데이터베이스는 노드와 관계로 저장해 연결을 따라 찾는다. 지식 그래프와 벡터 검색을 함께 쓰는 구성도 늘고 있다.

참고 자료

우리 브랜드는 AI 답변에 나오고 있을까?

서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.

GEO 최적화 서비스 보기