지식 그래프란 무엇인가

지식 그래프(Knowledge Graph)는 사람, 장소, 사물 같은 실체를 노드로 두고 그 실체들 사이의 관계를 엣지로 이어, 현실 세계의 지식을 기계가 읽을 수 있게 저장한 데이터 구조다.

표를 쓰는 데이터베이스가 행과 열로 값을 담는다면, 지식 그래프는 점과 선으로 대상과 관계를 담는다.

검색엔진이 단어 대신 실체를 이해하는 근거이자, RAG가 흩어진 사실을 이어 붙이는 재료다.

지식 그래프는 어떻게 이루어져 있는가?

노드와 엣지, 그리고 그 둘을 묶은 문장 단위인 트리플로 이루어진다. 가장 작은 단위는 “주어 - 관계 - 목적어” 세 조각이다.

학계의 표준 참고 문헌인 ACM 컴퓨팅 서베이의 지식 그래프 논문은 지식 그래프를 “현실 세계의 지식을 축적하고 전달하기 위한 데이터 그래프로, 노드는 관심 대상인 엔티티를, 엣지는 그 엔티티들 사이의 관계를 나타낸다”고 정의한다 (Hogan 외, Knowledge Graphs, ACM Computing Surveys 54(4), 2021).

구성 요소담는 것
노드실체 하나서울, 대한민국, 세종대왕
엣지실체 사이의 관계수도이다, 태어났다
속성실체에 딸린 값인구, 설립 연도
트리플노드-엣지-노드 한 벌서울 - 수도이다 - 대한민국

같은 논문은 데이터 모델이 하나로 정해져 있지 않다고 짚는다. 널리 쓰이는 형태는 두 가지다.

  1. 방향성 엣지 라벨 그래프. W3C의 RDF 표준이 여기 해당하고, 모든 정보를 트리플로만 표현한다. 공개 데이터 교환에 강하다.
  2. 속성 그래프. 노드와 엣지 자체에 속성을 붙일 수 있어 표현이 유연하다. 그래프 데이터베이스 제품들이 주로 채택한다.

“지식 그래프”라는 말의 정의 자체가 아직 논쟁 중이라는 점도 같은 논문이 명시한다. 제품 문서마다 범위가 조금씩 다른 이유다.

온톨로지와는 무엇이 다른가?

온톨로지는 규칙이고 지식 그래프는 그 규칙에 따라 쌓인 데이터다. 온톨로지가 설계도라면 지식 그래프는 그 설계도로 지은 건물이다.

같은 논문은 온톨로지를 “용어가 사용되는 범위 안에서 그 용어가 무엇을 의미하는지를 구체적이고 형식적으로 표현한 것”으로 정의한다. ‘행사’가 한 번만 일어나는지 여러 번 일어나는지 같은 물음에 정답은 없고, 어떻게 약속할지를 정하는 것이 온톨로지의 역할이라는 설명이다.

구분온톨로지지식 그래프
정체개념과 관계의 정의정의에 따라 채워진 사실
담는 것”도시는 국가에 속한다""서울은 대한민국에 속한다”
바뀌는 빈도드물게계속
없어도 되는가없이도 그래프는 만들어짐온톨로지만으로는 지식이 없음

온톨로지 없이 만든 지식 그래프는 관계 이름이 제각각이 되기 쉽다. ‘소속’과 ‘속함’과 ‘소속사’가 뒤섞이면 같은 질문에 답이 갈린다.

구글 지식 그래프는 검색에서 무엇을 하는가?

검색어가 가리키는 대상을 확정하고, 그 대상에 대해 알고 있는 사실을 검색 결과에 직접 보여준다.

구글은 2012년 지식 그래프를 공개하면서 검색이 “문자열이 아니라 실체(things, not strings)“를 다루게 됐다고 밝혔다. 당시 규모는 객체 5억 개 이상, 객체 사이의 사실과 관계 35억 개 이상이었다 (Google, Introducing the Knowledge Graph: things, not strings).

구글은 지금도 지식 그래프를 “인물, 장소, 사물에 관한 수많은 사실이 저장된 데이터베이스”로 설명하며, 이 덕분에 “에펠탑의 높이는?” 같은 사실 질문에 답할 수 있다고 밝힌다 (구글, Google 지식 그래프의 작동 방식).

검색 결과 오른쪽에 뜨는 지식 패널이 그 결과물이다. 같은 문서에 따르면 지식 패널은 신청해서 만드는 것이 아니라 “공개된 인터넷에서 충분한 정보를 가져올 수 있는 경우 검색 알고리즘에 의해 자동으로 생성”된다.

외부에서도 조회할 수 있다. 구글의 지식 그래프 검색 API는 각 항목에 g.co/kg로 시작하는 고유 식별자를 붙여 돌려주고, 응답은 schema.org 유형과 JSON-LD 규격을 따른다 (구글, Google 지식 그래프 검색 API).

브랜드가 이 그래프에 하나의 대상으로 자리 잡는 문제는 엔티티에서 다룬다.

지식 그래프는 어디에 쓰이는가?

여러 시스템에 흩어진 데이터를 하나의 의미망으로 묶어야 하는 곳에 쓰인다.

  • 검색과 질의응답. 검색어의 대상을 확정하고 사실 질문에 바로 답한다.
  • 추천. 사용자와 상품을 관계로 이어 취향이 비슷한 항목을 찾는다.
  • 이상 거래 탐지. 계좌와 기기와 사람의 연결 고리를 따라가며 정상 범위를 벗어난 경로를 찾는다.
  • 공급망 관리. 부품과 공급사와 공장의 의존 관계를 추적한다.
  • 사내 지식 관리. 부서마다 다른 이름으로 부르던 대상을 하나로 묶는다.

공통점은 답이 한 곳에 있지 않다는 것이다. 여러 조각을 이어야 나오는 답이라면 그래프가 유리하다.

지식 그래프를 붙이면 RAG 답변이 얼마나 좋아지는가?

마이크로소프트 연구진이 측정한 결과, 지식 그래프를 붙인 GraphRAG는 문서 전체를 아우르는 질문에서 일반 벡터 RAG보다 답변의 완전성과 다양성이 크게 앞섰다.

100만 토큰 규모의 데이터셋에 비교당 질문 125개를 던져 두 방식의 답을 맞붙인 실험이다. 완전성 기준 승률은 팟캐스트 원고에서 7283%, 뉴스 기사에서 7280%였고, 다양성 승률은 각각 7582%와 6271%였다 (Edge 외, From Local to Global: A Graph RAG Approach to Query-Focused Summarization).

비교 항목GraphRAG 승률 (팟캐스트)GraphRAG 승률 (뉴스)
완전성72~83%72~80%
다양성75~82%62~71%

비용도 함께 봐야 한다. 같은 논문에서 최상위 요약만 쓰는 구성은 원문을 통째로 요약하는 방식보다 컨텍스트 토큰을 97% 넘게 적게 썼고, 그러면서도 벡터 RAG 대비 완전성 승률 72%와 다양성 승률 62%를 유지했다.

모든 질문에서 이기는 것은 아니다. 같은 실험의 대조 지표인 직접성에서는 벡터 RAG가 모든 비교에서 가장 앞섰다.

정리하면 “이 자료의 핵심 주제가 무엇인가” 같은 넓은 질문은 그래프가, “이 조항의 기한은 며칠인가” 같은 좁은 질문은 벡터 검색이 낫다. 마이크로소프트는 일반 RAG의 한계를 “점들을 잇는 데 어려움을 겪는다”고 표현했다 (Microsoft Research, GraphRAG: Unlocking LLM discovery on narrative private data).

RAG의 기본 구조는 RAG에, 답변을 근거에 묶는 문제는 그라운딩에, 문서를 자르는 단위는 청킹에 정리했다.

지식 그래프는 어떻게 구축하는가?

무엇을 노드로 볼지 정하고, 흩어진 데이터에서 실체와 관계를 뽑아 트리플로 쌓는 순서다.

  1. 범위를 정한다. 답하고 싶은 질문 목록을 먼저 쓰면 필요한 노드와 관계가 드러난다.
  2. 온톨로지를 만든다. 어떤 유형이 있고 어떤 관계가 허용되는지 정한다. schema.org의 유형 체계를 그대로 빌려 써도 된다.
  3. 실체를 뽑는다. 문서와 데이터베이스에서 대상 이름을 찾아내고 같은 대상끼리 묶는다. 최근에는 이 단계를 LLM에 맡기는 방식이 늘었다.
  4. 식별자를 붙인다. 표기가 달라도 같은 대상이면 같은 식별자로 이어야 한다.
  5. 저장하고 질의한다. RDF 계열은 SPARQL로, 속성 그래프 계열은 각 제품의 질의 언어로 조회한다.

3번이 실무에서 가장 오래 걸린다. 같은 회사를 ‘㈜서치폴라리스’, ‘서치폴라리스’, ‘SearchPolaris’로 부르는 자료를 하나로 묶는 일이 여기서 벌어진다.

웹 콘텐츠 쪽에서는 구조화된 데이터가 지름길이다. 구글은 구조화된 데이터를 “페이지에 관한 정보를 제공하고 페이지 콘텐츠를 분류하기 위한 표준화된 형식”으로 설명한다 (구글 검색 센터, 구조화된 데이터 마크업 소개).

자주 묻는 질문

지식 그래프와 그래프 데이터베이스는 같은 것인가?

다른 것이다. 그래프 데이터베이스는 그래프 형태의 데이터를 저장하고 조회하는 소프트웨어이고, 지식 그래프는 그 안에 담기는 내용물이다.

그래프 데이터베이스에 소셜 네트워크의 친구 관계만 넣으면 그것은 지식 그래프가 아니다. 현실 세계의 지식을 축적하고 전달하려는 의도가 있을 때 지식 그래프가 된다는 것이 앞의 ACM 논문의 정의다.

반대로 지식 그래프를 관계형 데이터베이스나 트리플 저장소에 담아도 된다. 저장 기술과 데이터의 성격은 별개다.

공개된 지식 그래프에는 어떤 것이 있는가?

가장 큰 공개 지식 그래프는 위키미디어 재단이 운영하는 위키데이터다. 2026년 8월 22일 기준 항목 수가 1억 2,000만 개를 넘는다 (Wikidata, Statistics).

위키백과 문서 뒤에 붙어 있는 사실 데이터가 대부분 여기서 온다. 구글도 초기 지식 그래프를 프리베이스와 위키백과 같은 공개 자료에 기반해 만들었다고 밝힌 바 있다.

브랜드 입장에서 위키데이터 항목은 확인하기 쉬운 출발점이다. 여러 서비스가 이 데이터를 그대로 가져다 쓰기 때문에 여기서 어긋난 사실은 여러 곳에서 동시에 어긋난다.

참고 자료

우리 브랜드는 AI 답변에 나오고 있을까?

서치폴라리스가 AI 검색 가시성을 진단하고 GEO 실행까지 대행합니다.

GEO 최적화 서비스 보기