한국특허청(KIPO) 출원용 명세서 초안

AI 기반 멀티소스 지식 통합 관리 및
RAG 검색 시스템

다양한 입력 소스에서 수집된 지식을 AI로 구조화·임베딩하고, RAG 파이프라인과 온톨로지 그래프로 제공하는 시스템에 관한 발명

출원인심재우
발명자심재우
출원 연도2026
기술 분야G06F 40/40 / G06N 20/00
📄
발명 표지
발명의 명칭
AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템 및 그 방법
출원인 성명
심재우
출원인 이메일
jaiwshim@gmail.com
발명자 성명
심재우
출원 연도
2026
국제특허분류(IPC)
G06F 40/40, G06N 20/00, G06F 16/903
한국특허분류(CPC)
G06F 40/40, G06N 3/04, G06F 16/9535
발명의 분야
인공지능 기반 지식 관리 및 정보 검색 시스템
관련 선행기술
RAG(Retrieval-Augmented Generation), pgvector, Knowledge Graph
우선권 주장
없음 (최초 출원)
🔬
기술 분야

본 발명은 인공지능(AI) 기반의 지식 관리 시스템에 관한 것으로, 보다 상세하게는 텍스트, 파일, 웹 URL, 통화 기록 등 복수의 이질적인 입력 소스로부터 지식을 수집·정규화·벡터 임베딩하고, 이를 RAG(Retrieval-Augmented Generation) 파이프라인과 온톨로지 그래프로 제공하는 통합 시스템 및 그 방법에 관한 것이다.

📚
배경 기술
  • 기존 지식 관리 시스템의 한계

    종래의 문서 관리 시스템(DMS)은 키워드 검색과 파일 저장에 특화되어 있어, 지식 간의 의미적 연관성을 파악하거나 자연어 질의에 정확히 응답하는 데 한계가 있었다. 특히, 조직 내 암묵지(Tacit Knowledge)는 체계적으로 수집·구조화되지 않아 지식 손실이 빈번히 발생하였다.

  • RAG 기술의 미성숙한 UI/UX 통합

    대규모 언어 모델(LLM)과 벡터 검색을 결합한 RAG 기술이 제안되었으나, 이를 비전문가가 쉽게 사용할 수 있는 통합 UI/UX 플랫폼으로 구현한 사례는 드물다. 특히, 출처 추적·신뢰도 표시·세션 관리가 통합된 엔드-투-엔드 시스템은 부재하였다.

  • 이질적 입력 소스 통합의 어려움

    텍스트, PDF, URL, 음성 통화 등 형식이 다른 입력 소스를 단일 파이프라인으로 처리하는 표준화된 방법이 없어, 각 소스마다 별도의 처리 시스템을 구축해야 하는 비효율이 존재하였다.

  • 온톨로지 자동 생성의 부재

    입력된 지식에서 엔티티와 관계를 자동으로 추출하여 구조화된 온톨로지 그래프를 실시간 생성하고, 이를 3D 인터랙티브 시각화로 제공하는 통합 솔루션은 존재하지 않았다.

🎯
발명이 해결하려는 과제
  • [과제 1] 멀티소스 지식 수집 통합

    텍스트, 파일(PDF/DOCX/TXT), 웹 URL, 통화 기록(STT 변환 텍스트)이라는 이질적인 4가지 입력 소스를 단일 표준화 파이프라인으로 처리하여, 사용자가 별도의 변환 작업 없이 모든 소스의 지식을 동일한 인터페이스에서 관리할 수 있도록 하는 것을 목적으로 한다.

  • [과제 2] 의미 기반 고정밀 검색

    키워드 일치 방식의 한계를 극복하여, 자연어 질의의 의미를 이해하고 관련 지식을 정확히 검색하되, 기존 키워드 검색의 정확성도 함께 확보하는 하이브리드 검색 시스템을 구현하는 것을 목적으로 한다.

  • [과제 3] 출처 추적 가능한 AI 응답 생성

    LLM이 생성한 답변의 근거가 된 지식 노드를 사용자에게 명확히 제시하여, AI 답변의 신뢰성을 높이고 환각(Hallucination) 리스크를 최소화하는 것을 목적으로 한다.

  • [과제 4] 자동 지식 구조화 및 온톨로지 생성

    입력된 비구조화 텍스트에서 엔티티와 관계를 자동으로 추출하여 방향성 그래프로 저장하고, 이를 실시간으로 3D 시각화하여 지식 체계를 직관적으로 파악할 수 있도록 하는 것을 목적으로 한다.

  • [과제 5] 적응형 AI 분류 학습

    사용자의 분류 수정 피드백을 AI 분류 모델에 지속적으로 반영하여, 사용할수록 분류 정확도가 향상되는 적응형 학습 루프를 구현하는 것을 목적으로 한다.

🔧
과제를 해결하기 위한 수단
  • 멀티소스 수집 모듈

    텍스트 입력 파서, PDF/DOCX 파일 파서, 웹 크롤러, STT 텍스트 처리기를 포함하는 멀티소스 수집 모듈을 포함하며, 각 소스에서 추출된 원시 텍스트를 표준 데이터 구조(제목, 본문, 메타데이터)로 정규화하는 전처리 파이프라인을 구비한다.

  • 벡터 임베딩 생성 및 저장 수단

    정규화된 텍스트를 대규모 언어 모델의 임베딩 API에 전달하여 고차원(1536차원) 벡터 표현을 생성하고, 이를 관계형 데이터베이스의 벡터 확장(pgvector)에 저장하는 수단을 포함하며, 코사인 유사도 기반 ANN 인덱스를 구축하여 밀리초 단위 의미 검색을 지원한다.

  • RRF 기반 하이브리드 검색 엔진

    사용자 질의에 대해 Full-Text Search 결과와 벡터 유사도 검색 결과를 Reciprocal Rank Fusion(RRF) 알고리즘으로 결합하여 단일 통합 랭킹을 산출하는 하이브리드 검색 엔진을 포함한다. 카테고리, 태그, 날짜 범위, 소스 유형을 AND 조건으로 필터링하는 수단을 더 포함한다.

  • 5단계 RAG 파이프라인

    (a) 질의 임베딩 생성 → (b) 상위 K개 지식 노드 검색 → (c) 검색된 청크로 컨텍스트 윈도우 구성 → (d) LLM 프롬프트 생성 및 답변 스트리밍 → (e) 출처 카드(신뢰도 점수 포함) 렌더링의 5단계로 구성된 RAG 파이프라인을 포함한다.

  • 자동 온톨로지 생성 엔진

    AI 언어 모델을 이용하여 텍스트에서 엔티티(사람, 조직, 개념, 이벤트)를 자동 추출하고, 엔티티 간 관계(포함, 참조, 영향, 생성)를 규명하여 방향성 그래프 데이터베이스에 저장하는 온톨로지 생성 엔진을 포함하며, force-directed 알고리즘을 적용한 3D 인터랙티브 시각화 수단을 더 포함한다.

  • 적응형 분류 피드백 루프

    AI 자동 분류 결과에 대한 사용자 수정 행동을 피드백 데이터로 수집하고, 이를 분류 모델 미세조정(fine-tuning)에 활용하여 분류 정확도를 지속적으로 개선하는 적응형 학습 루프를 포함한다.

📈
발명의 효과
효과 항목기존 기술본 발명개선율
검색 정확도 (의미 기반)키워드 일치 방식하이브리드 RRF+40~60%↑
지식 입력 소요 시간소스별 개별 처리 필요단일 파이프라인 통합-70% 단축
AI 답변 신뢰도출처 미제공출처 카드 + 신뢰도 점수환각 리스크 -50%
온톨로지 구축 시간수동 구축 (전문가 필요)자동 생성 (비전문가 가능)-95% 이상
분류 정확도 (적응형)정적 분류 규칙피드백 기반 지속 학습6개월 후 +30%↑
  • 조직 지식 보존 효과

    퇴직·이직으로 인한 암묵지 손실을 방지하고, 조직 전체의 집단 지식을 구조화·디지털화하여 영구 보존하는 효과가 있다.

  • 의사결정 속도 향상

    RAG 챗봇을 통해 방대한 지식 베이스에서 관련 정보를 수 초 내에 검색·요약 제공함으로써, 담당자의 정보 탐색 시간을 대폭 단축하는 효과가 있다.

  • 지식 체계 가시화

    온톨로지 3D 시각화를 통해 지식 간 연결 구조를 직관적으로 파악할 수 있어, 전략 수립 및 신규 인사이트 도출에 유리한 효과가 있다.

🗺️
도면의 간단한 설명
도면 번호도면 명칭설명
도 1시스템 전체 아키텍처멀티소스 입력 → 처리 파이프라인 → 저장소 → 서비스 레이어의 전체 구성도
도 2멀티소스 수집 파이프라인4가지 입력 소스별 처리 흐름 및 정규화 과정 상세 다이어그램
도 3RAG 파이프라인 순서도질의 임베딩 → 검색 → 컨텍스트 조합 → 생성 → 출처 렌더링의 5단계 플로우차트
도 4하이브리드 검색 RRF 알고리즘Full-Text Search와 벡터 검색 결과의 RRF 통합 랭킹 산출 과정
도 5온톨로지 자동 생성 흐름텍스트 → 엔티티 추출 → 관계 규명 → 그래프 저장 → 3D 시각화
도 6데이터베이스 스키마knowledge_nodes, ontology_nodes/edges, chat_sessions 테이블 관계도(ER 다이어그램)
도 7사용자 인터페이스 화면대시보드, 챗봇, 검색, 온톨로지 뷰의 주요 UI 화면 구성
[도 1] 시스템 전체 아키텍처 구성도
[도 1] AX Knowledge Brain 시스템 아키텍처 입력 소스 텍스트 입력 파일 업로드 URL 크롤링 통화 기록 처리 파이프라인 전처리·정규화 AI 자동 분류 벡터 임베딩 온톨로지 추출 저장소 PostgreSQL pgvector 인덱스 온톨로지 그래프 세션 기록 서비스 레이어 RAG 챗봇 API 하이브리드 검색 (RRF) 대시보드 KPI API REST API / Webhook 클라이언트 인터페이스 (Web Browser) 📊 대시보드 KPI · 차트 · 통계 💬 RAG 챗봇 질의·출처·세션 🔍 하이브리드 검색 키워드+벡터 🕸️ 온톨로지 3D 그래프 탐색 📥 지식 입력 멀티소스 © 2026 심재우 · AX Knowledge Brain
🔨
발명을 실시하기 위한 구체적인 내용
  • [실시예 1] 영업 통화 기록 지식화

    영업 담당자가 STT로 변환된 고객 통화 기록 텍스트를 지식 입력 인터페이스에 붙여넣는다. 시스템은 자동으로 ① 텍스트 전처리, ② Gemini 임베딩 생성, ③ "영업/고객" 카테고리 자동 분류, ④ 고객명·제품명 엔티티 추출, ⑤ 온톨로지 노드 생성을 순차 처리한다. 이후 "A 고객의 주요 불만 사항이 뭐야?"라는 자연어 질문을 챗봇에 입력하면, 저장된 통화 기록 노드에서 관련 청크를 검색하여 출처 카드와 함께 요약 답변을 생성한다.

  • [실시예 2] PDF 문서 지식 베이스 구축

    사용자가 회사 규정집 PDF 파일을 파일 업로드 인터페이스에 드래그앤드롭한다. 시스템은 PDF 파서로 텍스트를 추출하고, 1000자 단위로 청크 분할 후 각 청크를 개별 지식 노드로 저장·임베딩한다. "연차 신청 절차" 질의 시 관련 규정 조항이 포함된 청크를 검색하여 응답한다.

  • [실시예 3] URL 크롤링 + 자동 분류

    사용자가 경쟁사 블로그 URL을 입력하면 웹 크롤러가 페이지 본문을 수집한다. AI 분류기가 "경쟁사 동향" 카테고리로 자동 분류하고 주요 키워드를 태그로 추출한다. 사용자가 분류를 "마케팅 인사이트"로 수정하면, 이 피드백이 분류 모델 개선에 반영된다.

💻
핵심 알고리즘 코드
// RRF 하이브리드 검색 핵심 코드 async function hybridSearch(query, options = {}) { const { topK = 10, threshold = 0.6 } = options; // 1. 질의 임베딩 const qEmbedding = await embed(query); // 2. 벡터 검색 (pgvector) const vectorResults = await db.rpc('match_knowledge', { query_embedding: qEmbedding, match_threshold: threshold, match_count: topK * 2 }); // 3. 키워드 검색 (Full-Text) const textResults = await db.from('knowledge_nodes') .select('id, title, content, ts_rank') .textSearch('content_fts', query) .limit(topK * 2); // 4. RRF 통합 랭킹 const k = 60; // RRF 상수 const scoreMap = {}; vectorResults.forEach((r, i) => { scoreMap[r.id] = (scoreMap[r.id] || 0) + 1 / (k + i + 1); }); textResults.forEach((r, i) => { scoreMap[r.id] = (scoreMap[r.id] || 0) + 1 / (k + i + 1); }); return Object.entries(scoreMap) .sort(([,a],[,b]) => b - a) .slice(0, topK) .map(([id, score]) => ({ id, score })); }
📋
청구범위
【청구항 1】 (독립항)

다양한 입력 소스로부터 지식을 수집하여 AI 기반으로 관리하는 시스템으로서, 텍스트, 파일, 웹 URL 및 통화 기록을 포함하는 복수의 이질적 입력 소스로부터 정보를 수집하고 정규화된 형식으로 변환하는 멀티소스 수집 모듈; 수집된 정보를 AI 언어 모델의 임베딩 API를 이용하여 고차원 벡터로 변환하고 벡터 데이터베이스에 저장하는 임베딩 처리 모듈; Full-Text Search 결과와 벡터 유사도 검색 결과를 RRF(Reciprocal Rank Fusion) 알고리즘으로 통합하는 하이브리드 검색 모듈; 및 사용자 질의에 대해 상기 하이브리드 검색 모듈의 결과를 컨텍스트로 활용하여 AI가 출처가 명시된 답변을 생성하는 RAG 파이프라인 모듈;을 포함하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

【청구항 2】 (청구항 1의 종속항)

청구항 1에 있어서, 상기 시스템은 수집된 지식으로부터 엔티티(사람, 조직, 개념, 이벤트) 및 관계를 자동 추출하여 방향성 그래프 데이터베이스에 저장하는 온톨로지 생성 엔진을 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

【청구항 3】 (청구항 2의 종속항)

청구항 2에 있어서, 상기 온톨로지 생성 엔진은 force-directed 알고리즘을 이용한 3D 인터랙티브 시각화 수단을 더 포함하고, 노드의 크기를 해당 노드의 연결 수(중심성, centrality)에 비례하여 렌더링하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

【청구항 4】 (청구항 1의 종속항)

청구항 1에 있어서, 상기 RAG 파이프라인 모듈은 검색된 각 지식 노드의 신뢰도 점수(0~100)를 출처 카드 형태로 사용자 인터페이스에 표시하는 수단을 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

【청구항 5】 (독립항 - 방법 청구항)

컴퓨터로 실행되는 AI 기반 멀티소스 지식 통합 관리 및 검색 방법으로서, (a) 복수의 이질적 입력 소스로부터 정보를 수집하고 표준 형식으로 정규화하는 단계; (b) 정규화된 정보를 AI 언어 모델로 임베딩하여 벡터 데이터베이스에 저장하는 단계; (c) 사용자 질의에 대해 Full-Text Search와 벡터 검색을 병렬 수행하고 RRF 알고리즘으로 통합 랭킹을 생성하는 단계; (d) 통합 랭킹 상위 K개 지식 노드를 컨텍스트로 구성하여 AI 언어 모델에 전달하는 단계; 및 (e) 생성된 답변과 함께 출처 카드 및 신뢰도 점수를 사용자에게 제공하는 단계;를 포함하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 방법.

【청구항 6】 (청구항 5의 종속항)

청구항 5에 있어서, 상기 방법은 AI 자동 분류 결과에 대한 사용자 수정 피드백을 수집하고, 이를 분류 모델 미세조정에 반영하여 분류 정확도를 지속적으로 개선하는 적응형 학습 단계를 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 방법.

【청구항 7】 (독립항 — 스킬·하네스 시스템)

청구항 1의 시스템에 있어서, 상기 시스템은 지식 항목을 입력 받아 AI 언어 모델이 핵심 요약(summary), 실행 방법(how_to), 활용 사례(use_case)를 자동 추출하여 스킬(skill) 객체로 저장하는 스킬 생성 모듈; 및 복수의 스킬을 사용자가 정의한 실행 순서(step_order)로 연결하여 하나의 업무 플로우를 구성하는 스킬 하네스(skill harness) 편집 모듈;을 더 포함하고, 상기 스킬 하네스는 적용 횟수(apply_count)를 집계하여 실효성이 높은 업무 플로우를 식별할 수 있는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

【청구항 8】 (독립항 — 부서 ERP 지식 분류)

청구항 1의 시스템에 있어서, 상기 시스템은 부서(Level 1)와 팀(Level 2)의 2단계 계층 구조로 구성된 조직 단위 테이블; 지식 항목의 수정 시 변경 전·후 데이터(before_data, after_data)를 JSONB 형식으로 자동 기록하고 변경 필드 목록(changed_fields)을 추적하는 수정 이력 추적 모듈; 및 명시지·암묵지·경험지·절차지·개념지·관계지·맥락지·감성지·실행지·메타지식의 10가지 유형으로 지식을 분류하는 지식 종류 분류 체계;를 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

【청구항 9】 (청구항 1의 종속항 — AI 지식 가치 분석)

청구항 1에 있어서, 상기 시스템은 저장된 지식 항목을 일괄 분석하여 핫토픽(hot_topics), 창의적 인사이트(creative_insights), 숨겨진 핵심 지식(gem_knowledge), 부서별 역량 강점(dept_strength), 지식 공백(knowledge_gaps) 및 전략적 권고(recommendation)를 구조화된 형식으로 출력하는 AI 지식 가치 분석 엔진을 더 포함하고, 상기 분석 결과는 일정 시간 동안 인메모리 캐시에 저장되어 API 호출 비용을 최소화하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.

발명의 명칭

AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템 및 그 방법

📝
요약서 전문
[요약]

본 발명은 텍스트, 파일, 웹 URL, 통화 기록을 포함하는 복수의 이질적 입력 소스로부터 지식을 수집·정규화하고, AI 임베딩으로 벡터화하여 관계형 벡터 데이터베이스에 저장하며, Full-Text Search와 벡터 유사도 검색을 RRF 알고리즘으로 통합하는 하이브리드 검색 엔진을 제공하고, 사용자 자연어 질의에 대해 출처 카드와 신뢰도 점수를 포함한 RAG 기반 AI 응답을 생성하며, 입력 지식에서 엔티티와 관계를 자동 추출하여 3D 온톨로지 그래프로 시각화하는 AI 기반 통합 지식 관리 시스템 및 그 방법에 관한 것이다. 본 발명에 의하면 조직의 암묵지를 체계적으로 디지털화하고, 의미 기반 고정밀 검색과 출처 추적 가능한 AI 응답으로 정보 탐색 효율을 대폭 향상시킬 수 있다.
대표 도면

【도 1】 — 시스템 전체 아키텍처 구성도 (도면설명 탭 참조)

핵심 키워드
RAG pgvector 하이브리드 검색 RRF 온톨로지 멀티소스 지식 관리 LLM
📎
부속서류 목록
서류 번호서류명형식설명
부속 1소스코드 목록ZIP/TXTapi/, js/ 디렉토리 전체 소스코드
부속 2데이터베이스 스키마SQL테이블 생성 스크립트 전문
부속 3도면 1~7SVG/PDF시스템 아키텍처 및 알고리즘 다이어그램
부속 4API 명세서OpenAPI 3.0REST API 엔드포인트 전체 명세
부속 5테스트 결과PDF검색 정확도·성능 벤치마크 결과
💾
핵심 소스코드 발췌
// api/rag-chat.js — RAG 파이프라인 핵심 export default async function handler(req, res) { const { question, session_id, top_k = 5 } = req.body; // Step 1: 질의 임베딩 const embedding = await generateEmbedding(question); // Step 2: 하이브리드 검색 const chunks = await hybridSearch(question, embedding, { topK: top_k }); // Step 3: 컨텍스트 조합 const context = chunks.map((c, i) => `[출처${i+1}] ${c.title}\n${c.content}` ).join('\n\n'); // Step 4: Gemini Pro 답변 생성 const prompt = `다음 지식을 기반으로 질문에 답하세요.\n\n${context}\n\n질문: ${question}`; const answer = await gemini.generateContent(prompt); // Step 5: 출처 카드 구성 const sources = chunks.map(c => ({ id: c.id, title: c.title, confidence: Math.round(c.score * 100) })); return res.json({ answer, sources, session_id }); }