다양한 입력 소스에서 수집된 지식을 AI로 구조화·임베딩하고, RAG 파이프라인과 온톨로지 그래프로 제공하는 시스템에 관한 발명
본 발명은 인공지능(AI) 기반의 지식 관리 시스템에 관한 것으로, 보다 상세하게는 텍스트, 파일, 웹 URL, 통화 기록 등 복수의 이질적인 입력 소스로부터 지식을 수집·정규화·벡터 임베딩하고, 이를 RAG(Retrieval-Augmented Generation) 파이프라인과 온톨로지 그래프로 제공하는 통합 시스템 및 그 방법에 관한 것이다.
종래의 문서 관리 시스템(DMS)은 키워드 검색과 파일 저장에 특화되어 있어, 지식 간의 의미적 연관성을 파악하거나 자연어 질의에 정확히 응답하는 데 한계가 있었다. 특히, 조직 내 암묵지(Tacit Knowledge)는 체계적으로 수집·구조화되지 않아 지식 손실이 빈번히 발생하였다.
대규모 언어 모델(LLM)과 벡터 검색을 결합한 RAG 기술이 제안되었으나, 이를 비전문가가 쉽게 사용할 수 있는 통합 UI/UX 플랫폼으로 구현한 사례는 드물다. 특히, 출처 추적·신뢰도 표시·세션 관리가 통합된 엔드-투-엔드 시스템은 부재하였다.
텍스트, PDF, URL, 음성 통화 등 형식이 다른 입력 소스를 단일 파이프라인으로 처리하는 표준화된 방법이 없어, 각 소스마다 별도의 처리 시스템을 구축해야 하는 비효율이 존재하였다.
입력된 지식에서 엔티티와 관계를 자동으로 추출하여 구조화된 온톨로지 그래프를 실시간 생성하고, 이를 3D 인터랙티브 시각화로 제공하는 통합 솔루션은 존재하지 않았다.
텍스트, 파일(PDF/DOCX/TXT), 웹 URL, 통화 기록(STT 변환 텍스트)이라는 이질적인 4가지 입력 소스를 단일 표준화 파이프라인으로 처리하여, 사용자가 별도의 변환 작업 없이 모든 소스의 지식을 동일한 인터페이스에서 관리할 수 있도록 하는 것을 목적으로 한다.
키워드 일치 방식의 한계를 극복하여, 자연어 질의의 의미를 이해하고 관련 지식을 정확히 검색하되, 기존 키워드 검색의 정확성도 함께 확보하는 하이브리드 검색 시스템을 구현하는 것을 목적으로 한다.
LLM이 생성한 답변의 근거가 된 지식 노드를 사용자에게 명확히 제시하여, AI 답변의 신뢰성을 높이고 환각(Hallucination) 리스크를 최소화하는 것을 목적으로 한다.
입력된 비구조화 텍스트에서 엔티티와 관계를 자동으로 추출하여 방향성 그래프로 저장하고, 이를 실시간으로 3D 시각화하여 지식 체계를 직관적으로 파악할 수 있도록 하는 것을 목적으로 한다.
사용자의 분류 수정 피드백을 AI 분류 모델에 지속적으로 반영하여, 사용할수록 분류 정확도가 향상되는 적응형 학습 루프를 구현하는 것을 목적으로 한다.
텍스트 입력 파서, PDF/DOCX 파일 파서, 웹 크롤러, STT 텍스트 처리기를 포함하는 멀티소스 수집 모듈을 포함하며, 각 소스에서 추출된 원시 텍스트를 표준 데이터 구조(제목, 본문, 메타데이터)로 정규화하는 전처리 파이프라인을 구비한다.
정규화된 텍스트를 대규모 언어 모델의 임베딩 API에 전달하여 고차원(1536차원) 벡터 표현을 생성하고, 이를 관계형 데이터베이스의 벡터 확장(pgvector)에 저장하는 수단을 포함하며, 코사인 유사도 기반 ANN 인덱스를 구축하여 밀리초 단위 의미 검색을 지원한다.
사용자 질의에 대해 Full-Text Search 결과와 벡터 유사도 검색 결과를 Reciprocal Rank Fusion(RRF) 알고리즘으로 결합하여 단일 통합 랭킹을 산출하는 하이브리드 검색 엔진을 포함한다. 카테고리, 태그, 날짜 범위, 소스 유형을 AND 조건으로 필터링하는 수단을 더 포함한다.
(a) 질의 임베딩 생성 → (b) 상위 K개 지식 노드 검색 → (c) 검색된 청크로 컨텍스트 윈도우 구성 → (d) LLM 프롬프트 생성 및 답변 스트리밍 → (e) 출처 카드(신뢰도 점수 포함) 렌더링의 5단계로 구성된 RAG 파이프라인을 포함한다.
AI 언어 모델을 이용하여 텍스트에서 엔티티(사람, 조직, 개념, 이벤트)를 자동 추출하고, 엔티티 간 관계(포함, 참조, 영향, 생성)를 규명하여 방향성 그래프 데이터베이스에 저장하는 온톨로지 생성 엔진을 포함하며, force-directed 알고리즘을 적용한 3D 인터랙티브 시각화 수단을 더 포함한다.
AI 자동 분류 결과에 대한 사용자 수정 행동을 피드백 데이터로 수집하고, 이를 분류 모델 미세조정(fine-tuning)에 활용하여 분류 정확도를 지속적으로 개선하는 적응형 학습 루프를 포함한다.
| 효과 항목 | 기존 기술 | 본 발명 | 개선율 |
|---|---|---|---|
| 검색 정확도 (의미 기반) | 키워드 일치 방식 | 하이브리드 RRF | +40~60%↑ |
| 지식 입력 소요 시간 | 소스별 개별 처리 필요 | 단일 파이프라인 통합 | -70% 단축 |
| AI 답변 신뢰도 | 출처 미제공 | 출처 카드 + 신뢰도 점수 | 환각 리스크 -50% |
| 온톨로지 구축 시간 | 수동 구축 (전문가 필요) | 자동 생성 (비전문가 가능) | -95% 이상 |
| 분류 정확도 (적응형) | 정적 분류 규칙 | 피드백 기반 지속 학습 | 6개월 후 +30%↑ |
퇴직·이직으로 인한 암묵지 손실을 방지하고, 조직 전체의 집단 지식을 구조화·디지털화하여 영구 보존하는 효과가 있다.
RAG 챗봇을 통해 방대한 지식 베이스에서 관련 정보를 수 초 내에 검색·요약 제공함으로써, 담당자의 정보 탐색 시간을 대폭 단축하는 효과가 있다.
온톨로지 3D 시각화를 통해 지식 간 연결 구조를 직관적으로 파악할 수 있어, 전략 수립 및 신규 인사이트 도출에 유리한 효과가 있다.
| 도면 번호 | 도면 명칭 | 설명 |
|---|---|---|
| 도 1 | 시스템 전체 아키텍처 | 멀티소스 입력 → 처리 파이프라인 → 저장소 → 서비스 레이어의 전체 구성도 |
| 도 2 | 멀티소스 수집 파이프라인 | 4가지 입력 소스별 처리 흐름 및 정규화 과정 상세 다이어그램 |
| 도 3 | RAG 파이프라인 순서도 | 질의 임베딩 → 검색 → 컨텍스트 조합 → 생성 → 출처 렌더링의 5단계 플로우차트 |
| 도 4 | 하이브리드 검색 RRF 알고리즘 | Full-Text Search와 벡터 검색 결과의 RRF 통합 랭킹 산출 과정 |
| 도 5 | 온톨로지 자동 생성 흐름 | 텍스트 → 엔티티 추출 → 관계 규명 → 그래프 저장 → 3D 시각화 |
| 도 6 | 데이터베이스 스키마 | knowledge_nodes, ontology_nodes/edges, chat_sessions 테이블 관계도(ER 다이어그램) |
| 도 7 | 사용자 인터페이스 화면 | 대시보드, 챗봇, 검색, 온톨로지 뷰의 주요 UI 화면 구성 |
영업 담당자가 STT로 변환된 고객 통화 기록 텍스트를 지식 입력 인터페이스에 붙여넣는다. 시스템은 자동으로 ① 텍스트 전처리, ② Gemini 임베딩 생성, ③ "영업/고객" 카테고리 자동 분류, ④ 고객명·제품명 엔티티 추출, ⑤ 온톨로지 노드 생성을 순차 처리한다. 이후 "A 고객의 주요 불만 사항이 뭐야?"라는 자연어 질문을 챗봇에 입력하면, 저장된 통화 기록 노드에서 관련 청크를 검색하여 출처 카드와 함께 요약 답변을 생성한다.
사용자가 회사 규정집 PDF 파일을 파일 업로드 인터페이스에 드래그앤드롭한다. 시스템은 PDF 파서로 텍스트를 추출하고, 1000자 단위로 청크 분할 후 각 청크를 개별 지식 노드로 저장·임베딩한다. "연차 신청 절차" 질의 시 관련 규정 조항이 포함된 청크를 검색하여 응답한다.
사용자가 경쟁사 블로그 URL을 입력하면 웹 크롤러가 페이지 본문을 수집한다. AI 분류기가 "경쟁사 동향" 카테고리로 자동 분류하고 주요 키워드를 태그로 추출한다. 사용자가 분류를 "마케팅 인사이트"로 수정하면, 이 피드백이 분류 모델 개선에 반영된다.
다양한 입력 소스로부터 지식을 수집하여 AI 기반으로 관리하는 시스템으로서, 텍스트, 파일, 웹 URL 및 통화 기록을 포함하는 복수의 이질적 입력 소스로부터 정보를 수집하고 정규화된 형식으로 변환하는 멀티소스 수집 모듈; 수집된 정보를 AI 언어 모델의 임베딩 API를 이용하여 고차원 벡터로 변환하고 벡터 데이터베이스에 저장하는 임베딩 처리 모듈; Full-Text Search 결과와 벡터 유사도 검색 결과를 RRF(Reciprocal Rank Fusion) 알고리즘으로 통합하는 하이브리드 검색 모듈; 및 사용자 질의에 대해 상기 하이브리드 검색 모듈의 결과를 컨텍스트로 활용하여 AI가 출처가 명시된 답변을 생성하는 RAG 파이프라인 모듈;을 포함하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
청구항 1에 있어서, 상기 시스템은 수집된 지식으로부터 엔티티(사람, 조직, 개념, 이벤트) 및 관계를 자동 추출하여 방향성 그래프 데이터베이스에 저장하는 온톨로지 생성 엔진을 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
청구항 2에 있어서, 상기 온톨로지 생성 엔진은 force-directed 알고리즘을 이용한 3D 인터랙티브 시각화 수단을 더 포함하고, 노드의 크기를 해당 노드의 연결 수(중심성, centrality)에 비례하여 렌더링하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
청구항 1에 있어서, 상기 RAG 파이프라인 모듈은 검색된 각 지식 노드의 신뢰도 점수(0~100)를 출처 카드 형태로 사용자 인터페이스에 표시하는 수단을 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
컴퓨터로 실행되는 AI 기반 멀티소스 지식 통합 관리 및 검색 방법으로서, (a) 복수의 이질적 입력 소스로부터 정보를 수집하고 표준 형식으로 정규화하는 단계; (b) 정규화된 정보를 AI 언어 모델로 임베딩하여 벡터 데이터베이스에 저장하는 단계; (c) 사용자 질의에 대해 Full-Text Search와 벡터 검색을 병렬 수행하고 RRF 알고리즘으로 통합 랭킹을 생성하는 단계; (d) 통합 랭킹 상위 K개 지식 노드를 컨텍스트로 구성하여 AI 언어 모델에 전달하는 단계; 및 (e) 생성된 답변과 함께 출처 카드 및 신뢰도 점수를 사용자에게 제공하는 단계;를 포함하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 방법.
청구항 5에 있어서, 상기 방법은 AI 자동 분류 결과에 대한 사용자 수정 피드백을 수집하고, 이를 분류 모델 미세조정에 반영하여 분류 정확도를 지속적으로 개선하는 적응형 학습 단계를 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 방법.
청구항 1의 시스템에 있어서, 상기 시스템은 지식 항목을 입력 받아 AI 언어 모델이 핵심 요약(summary), 실행 방법(how_to), 활용 사례(use_case)를 자동 추출하여 스킬(skill) 객체로 저장하는 스킬 생성 모듈; 및 복수의 스킬을 사용자가 정의한 실행 순서(step_order)로 연결하여 하나의 업무 플로우를 구성하는 스킬 하네스(skill harness) 편집 모듈;을 더 포함하고, 상기 스킬 하네스는 적용 횟수(apply_count)를 집계하여 실효성이 높은 업무 플로우를 식별할 수 있는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
청구항 1의 시스템에 있어서, 상기 시스템은 부서(Level 1)와 팀(Level 2)의 2단계 계층 구조로 구성된 조직 단위 테이블; 지식 항목의 수정 시 변경 전·후 데이터(before_data, after_data)를 JSONB 형식으로 자동 기록하고 변경 필드 목록(changed_fields)을 추적하는 수정 이력 추적 모듈; 및 명시지·암묵지·경험지·절차지·개념지·관계지·맥락지·감성지·실행지·메타지식의 10가지 유형으로 지식을 분류하는 지식 종류 분류 체계;를 더 포함하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
청구항 1에 있어서, 상기 시스템은 저장된 지식 항목을 일괄 분석하여 핫토픽(hot_topics), 창의적 인사이트(creative_insights), 숨겨진 핵심 지식(gem_knowledge), 부서별 역량 강점(dept_strength), 지식 공백(knowledge_gaps) 및 전략적 권고(recommendation)를 구조화된 형식으로 출력하는 AI 지식 가치 분석 엔진을 더 포함하고, 상기 분석 결과는 일정 시간 동안 인메모리 캐시에 저장되어 API 호출 비용을 최소화하는 것을 특징으로 하는 AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템.
AI 기반 멀티소스 지식 통합 관리 및 RAG 검색 시스템 및 그 방법
【도 1】 — 시스템 전체 아키텍처 구성도 (도면설명 탭 참조)
| 서류 번호 | 서류명 | 형식 | 설명 |
|---|---|---|---|
| 부속 1 | 소스코드 목록 | ZIP/TXT | api/, js/ 디렉토리 전체 소스코드 |
| 부속 2 | 데이터베이스 스키마 | SQL | 테이블 생성 스크립트 전문 |
| 부속 3 | 도면 1~7 | SVG/PDF | 시스템 아키텍처 및 알고리즘 다이어그램 |
| 부속 4 | API 명세서 | OpenAPI 3.0 | REST API 엔드포인트 전체 명세 |
| 부속 5 | 테스트 결과 | 검색 정확도·성능 벤치마크 결과 |