두 텍스트를 붙여넣고 TF-IDF 벡터, 코사인 유사도, N-gram 중복, 단어 수준 하이라이팅으로 유사도를 분석하세요. 어떤 단어와 구문이 일치하는지 정확히 확인할 수 있습니다.
📊 유사도 점수
4가지 알고리즘의 가중 합산으로 최종 점수를 산출합니다. Ring 게이지 + 색상 판정 5단계.
코사인 유사도 (45%) — TF-IDF 벡터 간의 각도. 문서 길이와 무관
자카드 지수 (20%) — 공유 어휘 / 전체 고유 어휘 비율
바이그램 중복 F1 (20%) — 2단어 구문 일치율. 패러프레이징 탐지에 효과적
트라이그램 중복 F1 (15%) — 3단어 구문 일치율. 직접 복사의 강력한 지표
🔬 5가지 시각화 탭
📝 단어 비교 — 두 문서를 나란히 표시하고 단어별로 색상 구분
🔴 빨강 = 정확 일치 / 🟡 노랑 = 어간 일치 (패러프레이징) / 🟢 초록 = 고유 단어 / 회색 = 불용어
📐 벡터 공간 — TF-IDF 벡터를 2D로 투영해 단어를 점으로 시각화. 문서 A/B의 중심 벡터를 원점에서 화살표로 표시하고 두 벡터 사이의 각도(θ) 실시간 표시
📏 코사인 각도 — 단위 원에 두 문서 벡터를 그려 각도로 유사도를 직관적으로 표현. 공통 단어별 A/B TF-IDF 가중치 바 차트 제공
🧩 N-gram 히트맵 — 1/2/3-gram 전환 버튼으로 단어·2단어·3단어 구문 단위의 일치 여부를 격자로 시각화. 빨강 = 공유 / 파랑 = A 전용 / 주황 = B 전용
📊 단어 빈도 — 양쪽 문서의 TF-IDF 상위 단어를 바 형태로 비교. 공통 단어는 빨강으로 표시
🌐 언어 지원
영어 — TF-IDF, 불용어 제거, 접미사 기반 어간 추출 (ing/tion/ness 등)
한국어 — 어절 분리 + 조사·어미 제거 (에서/으로/합니다 등 40여 개), 1글자 및 접속사 불용어 처리
언어 자동 감지 (한글 문자 수 vs 영문자 수 비교)


