임베딩(Embedding)은 단어, 문장, 이미지 같은 데이터를 의미가 비슷할수록 서로 가까이 놓이도록 숫자 배열(벡터)로 바꾸는 머신러닝 기법이다. 그 결과로 나온 벡터 자체도 임베딩이라 부른다.
컴퓨터는 “강아지”라는 글자에서 뜻을 읽지 못한다. 임베딩은 “강아지”에 수백 개의 숫자를 배정하고 “개”와는 가깝게, “자동차”와는 멀게 놓아 뜻의 관계를 숫자 사이의 거리로 바꾼다.
머신러닝에서는 고차원의 복잡한 데이터를 더 낮은 차원의 수치 벡터 공간으로 사상하는 표현 학습 기법으로 정의한다 (Wikipedia, Embedding (machine learning)).
같은 말이 다른 뜻으로도 쓰인다. 폰트 임베딩은 PDF나 PPT 파일 안에 글꼴을 포함하는 일이고, 오피스의 OLE는 개체 삽입을 뜻한다.
이 문서는 머신러닝의 임베딩만 다룬다.
신경망이 학습하면서 데이터마다 수백에서 수천 개의 숫자를 배정하고, 함께 자주 등장하거나 뜻이 비슷한 것끼리 거리가 가까워지도록 그 숫자를 조정한다. 학습이 끝나면 그 숫자 배열이 임베딩이다.
임베딩 이전에는 단어마다 자리 하나를 배정하는 원핫 인코딩을 썼다. 구글은 이 방식의 문제로 입력이 클수록 가중치가 늘고, 가중치가 많을수록 학습 데이터와 계산과 메모리가 더 필요해 기기 안에서 돌리기 어렵다는 점을 든다 (Google for Developers, 머신러닝 단기집중과정 임베딩).
임베딩은 이 희소한 표현을 저차원으로 압축한다. 구글은 음식을 “샌드위치다움”, “디저트다움”, “수프다움” 세 축으로 놓는 예를 들고, 실제 단어 임베딩은 보통 256에서 1,024차원이라고 설명한다 (Google for Developers, 임베딩 공간과 정적 임베딩).
대량 학습이 실용화된 계기는 2013년 구글의 Word2Vec이다. 논문은 16억 단어 데이터에서 하루가 안 되는 시간에 고품질 단어 벡터를 학습했다고 보고했다 (Mikolov 외, Efficient Estimation of Word Representations in Vector Space).
Word2Vec은 단어 하나에 벡터 하나를 고정하는 정적 임베딩이다. 반면 BERT나 트랜스포머 계열은 주변 단어 정보를 반영해 같은 단어라도 문맥마다 다른 벡터를 만드는 문맥 임베딩을 쓴다 (Google for Developers, 임베딩 가져오기).
벡터 사이의 가까움은 코사인 유사도, 내적, 유클리드 거리로 잰다. 구글은 자사 임베딩 모델의 벡터가 정규화되어 있어 세 방식이 같은 유사도 순위를 낸다고 안내한다 (Google Cloud, Vertex AI 텍스트 임베딩 가져오기).
벡터는 숫자 배열이라는 형식이고, 인코딩은 규칙으로 데이터를 숫자에 대응시키는 일이고, 임베딩은 학습으로 뜻을 담은 벡터를 만드는 일이다. 임베딩은 벡터의 한 종류이지만 모든 벡터가 임베딩은 아니다.
| 구분 | 무엇인가 | 뜻을 담는가 | 예 |
|---|---|---|---|
| 벡터 | 숫자를 순서대로 늘어놓은 배열 | 형식일 뿐 | [0.12, -0.53, 0.88] |
| 인코딩 | 규칙으로 데이터를 숫자에 대응 | 담지 않음 | 원핫 인코딩, 아스키 코드 |
| 임베딩 | 학습으로 의미 관계를 반영한 벡터 | 담음 | Word2Vec, text-embedding-3 |
원핫 인코딩에서 “개”와 “강아지”는 서로 다른 자리에 1이 켜진 무관한 배열이다. 임베딩에서는 두 벡터가 가까이 놓여 비슷한 뜻이라는 정보가 남는다.
Elastic도 “임베딩과 벡터는 같은 것인가”라는 항목을 따로 두고, 임베딩을 단어와 문장과 데이터를 의미와 관계를 포착하는 숫자로 바꾸는 방법으로 설명한다 (Elastic, 벡터 임베딩이란 무엇인가요?).
임베딩하는 대상에 따라 나눈다. 텍스트 안에서도 단어, 문장, 문서 단위가 다르고, 이미지, 오디오, 그래프, 사용자와 상품처럼 텍스트가 아닌 대상도 임베딩한다 (Elastic, 위 인용).
| 종류 | 대상 | 대표 기법 | 주 용도 |
|---|---|---|---|
| 단어 임베딩 | 단어 하나 | Word2Vec, GloVe, FastText | 유사어, 번역 |
| 문장 임베딩 | 문장 | Sentence-BERT, USE | 시맨틱 검색, 중복 탐지 |
| 문서 임베딩 | 문서 전체 | Doc2Vec | 분류, 추천 |
| 이미지 임베딩 | 이미지 | CNN 계열(ResNet, VGG) | 이미지 검색, 분류 |
| 사용자 임베딩 | 사용자 행동 | 협업 필터링 | 개인화 추천 |
| 상품 임베딩 | 상품 | 구매 이력 학습 | 유사 상품 추천 |
| 그래프 임베딩 | 노드와 관계 | Node2Vec | 링크 예측, 커뮤니티 탐지 |
| 오디오 임베딩 | 소리 | 오디오 신경망 | 음악 추천, 음성 인식 |
IBM은 임베딩할 수 있는 객체로 단어, 텍스트, 이미지, 오디오, 그래프를 들고, 텍스트와 이미지를 같은 공간에 놓는 교차 모달 응용을 따로 설명한다 (IBM, 임베딩이란 무엇인가요?).
검색, 추천, 분류, 군집화, 이상 탐지처럼 “비슷한 것을 찾는” 일 전부다. OpenAI는 임베딩 용도로 검색, 클러스터링, 추천, 이상 감지, 다양성 측정, 분류 여섯 가지를 든다 (OpenAI, Embeddings guide).
검색에서 임베딩이 바꾼 것은 속도다. BERT로 1만 문장 중 가장 비슷한 쌍을 찾으면 약 65시간이 걸리지만, 문장 임베딩을 미리 만들어 코사인 유사도로 비교하는 Sentence-BERT는 정확도를 유지하며 약 5초에 끝낸다 (Reimers, Gurevych, Sentence-BERT).
벡터 검색과 시맨틱 검색은 이 원리로 검색어와 문서를 같은 공간에 놓고 거리로 결과를 고른다. 키워드 검색과 섞는 방식은 하이브리드 검색이다.
생성형 AI에서는 RAG의 검색 단계가 임베딩이다. RAG를 제안한 2020년 논문은 위키백과를 밀집 벡터 색인으로 만들고 신경망 검색기로 불러오는 구조를 썼다 (Lewis 외, Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks).
문서를 임베딩하기 전에 잘라 넣는 단위가 청킹이다. AI 검색이 어떤 문서를 답변 근거로 고르는지는 결국 문서 조각의 임베딩이 질문의 임베딩과 얼마나 가까운가에 달려 있다.
벤치마크 점수, 지원 언어, 벡터 차원과 비용, 입력 길이 넷을 보고, 마지막에 자기 데이터로 검증한다. 2026년 기준 상용 모델의 대표 사양은 다음과 같다.
| 모델 | 기본 차원 | MTEB 평균 | MIRACL 평균 | 최대 입력 |
|---|---|---|---|---|
| text-embedding-3-large (OpenAI) | 3,072 | 64.6 | 54.9 | 8,192 토큰 |
| text-embedding-3-small (OpenAI) | 1,536 | 62.3 | 44.0 | 8,192 토큰 |
| text-embedding-ada-002 (OpenAI) | 1,536 | 61.0 | 31.4 | 8,192 토큰 |
| gemini-embedding-001 (Google) | 3,072 | 미공개 | 미공개 | 2,048 토큰 |
OpenAI 수치는 2024년 1월 25일 발표 자료의 것이다 (OpenAI, New embedding models and API updates). 차원과 입력 한도는 각 사 문서 기준이다 (OpenAI, Embeddings guide, 위 인용 / Google AI for Developers, Gemini API 임베딩).
구글에서 “임베딩”은 월 2,400회, 영문 “embedding”은 3,600회 검색된다. 이 절의 수치는 서치폴라리스가 2026년 9월 27일 구글 키워드 플래너와 네이버 검색광고 API에서 직접 조회한 것이다.
| 키워드 | 구글 월 평균 | 12개월 범위 |
|---|---|---|
| embedding | 3,600 | 2,900~4,400 |
| 임베딩 | 2,400 | 1,600~2,400 |
| 임베딩 뜻 | 590 | 390~720 |
| 임베딩 모델 | 590 | 480~720 |
| 벡터 임베딩 | 260 | 170~390 |
구글 자동완성은 “임베딩 뜻”, “임베딩 모델”, “임베딩 벡터”, “임베딩 모델 추천”, “임베딩 모델 종류”, “임베딩 유사도”, “임베딩 모델 벤치마크” 순이다. 뜻을 묻는 수요와 모델을 고르는 수요가 함께 있다.
네이버는 사정이 다르다. “임베딩” 월 검색량은 PC 450회, 모바일 760회인데 네이버 지식iN 상위 10건 중 5건이 폰트 임베딩 질문이었고, 자동완성 3위는 시술 용어 “셀프임베딩”이었다.
네이버 사용자에게 임베딩은 아직 머신러닝 용어가 아니다.
데이터를 뜻이 비슷할수록 가까이 놓이는 숫자 배열로 바꾸는 것이다. 구글 “임베딩 뜻” 검색은 월 590회로 “임베딩” 검색의 4분의 1이다.
두 벡터의 코사인 유사도를 가장 많이 쓴다. 벡터가 정규화되어 있으면 내적이나 유클리드 거리도 같은 순위를 낸다 (Google Cloud, Vertex AI 문서, 위 인용).
영어와 다국어 검색이면 MTEB 64.6, MIRACL 54.9의 text-embedding-3-large가 공개 수치 기준 상위이고, 저장 비용이 문제면 차원을 256에서 1,024로 잘라 쓴다. 한국어는 MTEB에 평가가 없으니 자기 데이터로 직접 재야 한다 (OpenAI 발표 자료, 에스코어, 위 인용).
머신러닝과 무관한 뜻이다. 문서 파일 안에 글꼴 데이터를 포함해 글꼴이 없는 기기에서도 같은 모양으로 보이게 하는 일이고, 폰트 라이선스가 이 허용 여부를 따로 정한다.
서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.