📘 텍스트 분류 사용 설명서

이 가이드에서는 글 데이터 준비부터 열 설정, 학습, 예측, 저장과 공유까지 모든 과정을 쉽게 따라할 수 있도록 설명합니다.

📝 텍스트 분류 콘텐츠 소개

"텍스트 분류"는 글을 읽고 그 글이 어떤 종류인지 고르거나(분류), 글에 어울리는 숫자를 맞히는(회귀) AI 모델을 만드는 콘텐츠입니다.

예를 들어 영화 리뷰를 읽고 "긍정"인지 "부정"인지 고르거나, 상품 리뷰를 읽고 별점 1~5점을 맞히는 식입니다. 문자 메시지가 스팸인지, 인터넷 주소가 가짜 사이트인지도 같은 방법으로 배울 수 있습니다.

입력 데이터: AI가 읽을 글입니다. 리뷰, 문의 글, 문자 메시지처럼 한 칸에 글 하나가 들어갑니다. 글 열은 최대 2개까지 쓸 수 있습니다.

출력 데이터: AI가 맞힐 값입니다. "긍정/부정", "배송/환불/계정/기타"처럼 종류면 분류로, 별점이나 점수처럼 숫자면 회귀로 배웁니다. 출력 열이 여러 개면 분류와 회귀를 섞어 한 모델로 배웁니다.

모델은 글을 토큰(낱말 조각)으로 잘라 순서대로 읽는 작은 트랜스포머입니다. 토큰마다 벡터로 바꾼 뒤 어텐션이 토큰끼리 서로 보며 문맥을 섞고, 그 결과를 모아 출력 열마다 답을 냅니다. ChatGPT처럼 글을 만들지는 않고, 읽어서 고르기만 합니다.

🖥️ UI 컴포넌트 구성 소개

아래는 실제 페이지와 똑같이 움직이는 화면입니다. 예제 "영화 리뷰 감정 분류"가 들어 있으니 학습하기 버튼을 눌러 예측까지 따라가 보세요.

데이터를 준비하고 학습하기 버튼을 클릭하면 나만의 AI 모델이 만들어집니다.

텍스트 분류

간단 사용법

1️⃣ 데이터 준비

💬 AI로 빠르게 시작
원하는 데이터를 입력하면 AI가
글과 결과를 자동으로 만들어드립니다!

또는

엑셀 파일 업로드
시트 하나에 글 열과 결과 열을 함께 넣어 올리세요

예제 불러오기
리뷰 감정, 문의 분류, 별점, 스팸 문자, 가짜 사이트 예제를 바로 열어볼 수 있어요

⚠️ 엑셀 형식: 시트 하나만 씁니다 (원인/결과 두 시트는 자동으로 합쳐요)
첫 행은 열 이름, 첫 열은 항목(이름)입니다
글은 한 칸에 최대 200자, 빈칸은 안 됩니다
열은 항목 열을 빼고 최대 20개, 행은 최대 999개

2️⃣ 열 설정 & AI 학습

🧩 표가 올라오면 열마다 입력 / 출력 / 제외를 고릅니다.
입력은 텍스트 열만 (최대 2개), 나머지 열은 출력이에요.

🔎 글은 토큰으로 쪼갠 뒤, 학습 글에 나온 토큰을 많이 나온 순서로 모아 사전을 만들어요. 한 번만 나온 토큰도 담아요.
글을 사전 번호의 줄로 바꿔 작은 트랜스포머에 넣습니다. 토큰마다 임베딩 벡터가 되고, 어텐션이 낱말 순서와 문맥을 봅니다.

🎯 출력 열마다 분류(긍정/부정 같은 종류 고르기)인지 회귀(별점 같은 숫자 예측)인지 정해요.
출력이 여러 개면 분류와 회귀를 섞어도 한 모델로 배웁니다.

설정이 끝나면 페이지 아래의버튼을 눌러주세요!

학습이 끝나면 새 글을 넣어 예측하고
모델을 “저장, 공유”할 수 있습니다

톱니바퀴에서 문장 길이, 임베딩 차원, 헤드와 블록 수, 학습 횟수를 조정할 수 있어요
모델 크기는 10MB 안에서 만들어집니다. 넘으면 사전 크기를 줄여주세요

예: “영화 리뷰로 긍정 부정 감정 분류”, “고객 문의 글로 담당 부서와 긴급도 예측”, “상품 리뷰로 만족도 점수 예측”, “문자 메시지로 스팸 여부 분류” 등
생성 / 다운로드한 엑셀 데이터셋을 업로드하세요.
시트 하나만 읽습니다 (원인/결과 두 시트 파일은 자동으로 합쳐집니다). 첫 행은 열 이름, 첫 열은 항목(이름)입니다. 글은 한 칸에 최대 200자, 열 최대 20개, 행 최대 999개
항목
글
결과
데이터 불러오는 중...

제목

페이지 상단에 텍스트 분류 기능을 설명하는 제목이 표시됩니다.

간단 사용법

제목 오른쪽 아래의 "간단 사용법"을 누르면 데이터 준비부터 학습까지의 흐름이 한 장으로 펼쳐집니다. 다시 누르면 접힙니다.

AI로 데이터 만들기

입력 칸에 "영화 리뷰로 긍정 부정 감정 분류"처럼 만들고 싶은 데이터를 적고 보내면 AI가 글 열과 결과 열을 갖춘 표를 만들어 아래 표에 넣어 줍니다. 만드는 동안 진행 상황이 화면에 흐릅니다.

예: 고객 문의 글로 담당 부서와 긴급도 예측

예제 불러오기

예제 버튼을 누르면 브라우저에서 바로 표가 만들어집니다. 영화 리뷰 감정, 고객 문의 분류, 상품 리뷰 별점, 문자 스팸, 가짜 사이트 탐지 예제가 있고, 네이버 영화 리뷰 500개와 999개 엑셀은 실제 리뷰 파일을 받아 넣습니다. "더 많은 예제 보기"는 다른 사람이 공유한 프로젝트 목록을 엽니다.

엑셀 파일 업로드

점선 상자를 누르거나 엑셀 파일을 끌어다 놓으면 표에 올라갑니다. 올라간 뒤에는 상자에 파일명이 표시됩니다.

예: 영화 리뷰 감정 분류.xlsx

데이터 표

올라온 데이터를 보여 주는 표입니다. 첫 열은 항목(이름), 나머지가 데이터 열입니다. 이 페이지의 표는 엑셀, 예제, AI 생성으로만 채우고 칸을 직접 고치지는 않습니다. 값을 바꾸려면 표 아래의 다운로드 버튼()으로 엑셀을 받아 고친 뒤 다시 올려 주세요. 표 아래에는 행 수가 나옵니다.

열마다 세로줄이 역할 색으로 칠해집니다. 파란 줄은 입력(글), 주황 줄은 출력, 회색 줄은 제외한 열입니다.

입력과 출력 정하기 (열 설정 표)

데이터 표 아래에 열마다 역할과 종류를 정하는 표가 나옵니다. 처음에는 자동으로 추정해 두고, 언제든 바꿀 수 있습니다. 오른쪽 위의 "자동 추정으로 되돌리기"를 누르면 처음 값으로 돌아갑니다.

  • 역할: 입력은 AI가 읽는 글, 출력은 AI가 맞힐 값, 제외는 학습에 쓰지 않는 열입니다. 입력은 텍스트 열만 고를 수 있습니다.
  • 데이터 종류: 텍스트, 카테고리, 수치 중 하나입니다. 출력 열에서는 종류가 곧 학습 방식입니다. 카테고리면 분류, 수치면 회귀입니다.
  • 세부 설정: 입력 글 열은 사전 크기(500, 1000, 2000토큰)를, 회귀 출력 열은 정규화(0~1, -1~1, z-score, 없음)를 고릅니다.
  • 값 미리보기: 글 열은 평균 글자 수와 실제 사전 토큰 수, 카테고리 열은 종류, 수치 열은 최솟값과 최댓값과 평균이 나옵니다.

모델 구조 그림

열 설정 표 아래에 지금 설정으로 만들어질 모델이 그려집니다. 입력 카드에서 토큰 자리, 어텐션 상자, 자리 평균, 은닉층을 지나 출력 카드로 이어지고, 오른쪽 위에 파라미터 수와 모델 크기가 나옵니다. 그림의 어느 부분에든 마우스를 올리면 그 부분이 하는 일이 나옵니다.

학습하기

준비한 글 데이터로 AI 모델을 학습시키는 버튼입니다.

학습 설정

문장 길이, 임베딩 차원, 헤드와 블록 수, 학습 횟수 같은 설정을 조정할 수 있는 영역입니다. 자세한 설명은 아래 학습하기 절에 있습니다.

📸 수집하기

텍스트 분류를 잘 학습하려면 글과 답이 짝지어진 데이터가 충분히 있어야 합니다.

아래는 데이터를 모으는 세 가지 방법입니다.

하나의 주제 정하기

  • 먼저 학습할 주제를 정합니다. 예를 들어 "우리 반 급식 후기 감정 분류"를 고릅니다.
  • 글 열에 무엇을 적을지, 결과 열의 종류(예: 좋아요, 별로예요)나 숫자(예: 1~5점)를 어떻게 둘지 정합니다.
  • 종류마다 글이 비슷한 수로 모이도록 합니다. 한쪽에만 몰리면 AI가 그쪽만 고르게 됩니다.

데이터 입력 방법

AI로 만들기

  • 페이지 위 입력 칸에 주제를 적으면 AI가 글과 결과가 든 표를 만들어 줍니다.
  • 만든 표는 엑셀로 내려받아 글을 고치거나 더 보탠 뒤 다시 올릴 수 있습니다.

설문지 또는 엑셀 파일 활용

  • 학생마다 글 한 줄과 답을 적는 설문지를 만들어 배포합니다.
  • 모인 글을 엑셀 한 시트에 정리합니다. 한 행이 글 하나입니다.
  • 정리한 파일을 엑셀(.xlsx)로 저장해 업로드합니다.

구글 스프레드시트 활용

  • 공유한 스프레드시트에 각자 자기 글과 답을 한 행씩 입력합니다.
  • 모두 입력하면 엑셀 파일로 내려받아 업로드합니다.

엑셀 파일 데이터 입력 방법

엑셀 또는 구글 스프레드시트에 입력할 때는 다음 규칙을 따라야 합니다

시트 구성

  • 시트 하나에 글 열과 결과 열을 함께 넣습니다.
  • 첫 행은 열 이름, 첫 열은 항목(이름)입니다. 항목은 번호나 짧은 이름이면 됩니다.
  • 예전 텍스트 분류 페이지처럼 원인 시트와 결과 시트로 나눈 파일도 그대로 올리면 자동으로 한 시트로 합쳐집니다.

글 열

  • 한 칸에 글 하나를 적습니다. 글은 최대 200자입니다.
  • 글 열은 최대 2개까지 입력으로 쓸 수 있습니다.

결과 열

  • 종류를 고르게 하려면 "긍정", "부정"처럼 종류 이름을 그대로 적습니다. 종류는 최대 50개입니다.
  • 숫자를 맞히게 하려면 별점처럼 숫자를 적습니다.
  • 결과 열이 여러 개여도 됩니다. 열마다 분류인지 회귀인지 열 설정 표에서 정합니다.

크기와 빈칸

  • 열은 항목 열을 빼고 최대 20개, 행은 최대 999개입니다.
  • 학습에 쓰는 열에는 빈칸이 없어야 합니다. 빈칸이 있으면 학습하기를 눌렀을 때 몇 개인지 알려 줍니다.

예시

항목리뷰감정
1배우들 연기가 살아 있고 마지막 장면이 오래 남는다긍정
2이야기가 늘어지고 중간에 졸았다부정
3기대 없이 봤는데 웃다가 끝났다긍정

파일 업로드

  • 데이터를 모두 입력한 후, 파일을 엑셀(.xlsx) 형식으로 저장합니다.
  • 업로드하면 위의 규칙에 어긋난 곳을 알려 주니 고쳐서 다시 올리면 됩니다.
  • 형식이 헷갈리면 예제를 불러온 뒤 표 아래의 다운로드 버튼으로 엑셀을 받아 그 모양대로 채워 보세요.

📚 학습하기

사용자가 준비한 글을 바탕으로 AI 모델이 학습하여 결과를 예측하는 과정입니다.

학습은 브라우저 안에서 돌아가므로 글이 밖으로 나가지 않습니다. 사용자는 결과만 확인하면 됩니다.

학습하기

학습하기 버튼을 누르면 먼저 글을 토큰으로 나누는 토크나이저(약 2.3MB)를 받고, 학습 글에 나온 토큰으로 사전을 만든 뒤 학습이 시작됩니다. 학습 중에는 상단에 진행률 막대가 표시되고, 끝나면 예측 화면이 열립니다.

학습 설정

학습하기 버튼 옆의 톱니바퀴를 누르면 설정 창이 열립니다. 적용한 설정은 다음 학습하기부터 쓰이고, 이미 학습한 모델이 있으면 창 위에 지금 모델의 설정이 나옵니다. 모델은 10MB 안에서 만들어지며, 넘으면 임베딩 차원이나 블록 수를 줄이거나 열 설정에서 사전 크기를 줄여 주세요.

문장 길이 (32, 64, 100, 200)

글 하나에서 토큰을 몇 개까지 모델에 넣을지 정합니다. 넘는 뒷부분은 버리고, 모자라면 빈칸으로 채웁니다. 한국어는 글자 하나가 토큰 1~2개쯤 됩니다. 값 미리보기의 평균 글자 수를 보고 고르세요. 길수록 학습이 느려집니다.

임베딩 차원 (16, 32, 64)

토큰 하나를 몇 개의 숫자로 나타낼지 정합니다. 어텐션 블록의 폭이기도 합니다. 클수록 표현이 풍부하지만 모델이 커지고, 데이터가 적으면 외우기 쉽습니다.

헤드 수 (1, 2, 4)

어텐션을 몇 갈래로 나눠 볼지 정합니다. 헤드마다 임베딩 차원을 나눠 가지며(차원 / 헤드 수) 서로 다른 관계를 봅니다. 파라미터 수는 바뀌지 않습니다.

블록 수 (1, 2, 3)

어텐션 블록을 몇 개 쌓을지 정합니다. 많을수록 복잡한 패턴을 학습할 수 있지만 느려지고 과적합 위험이 있습니다.

학습 횟수 (Epoch)

입력한 데이터 전체를 몇 번 반복하여 학습할지 정하는 부분입니다. 글 데이터는 금방 외워서, 글이 많은 표는 10번 안에 검증 loss가 다시 오르고(과적합) 100행쯤의 작은 표는 40번은 돌아야 배웁니다. 그래서 기본값은 40번에 조기 종료를 켠 것입니다.

배치 크기 (Batch Size)

입력한 데이터 전체를 얼마큼 작은 부분으로 쪼개서 학습할지 정하는 부분입니다. 예를 들어 전체 데이터가 1000개이고 배치 크기가 100일 경우, 한 번에 100개의 데이터로 학습하게 됩니다. 배치 크기가 작을수록 모델이 더 자주 학습하고, 클수록 메모리를 더 씁니다. 기본값은 16입니다.

학습률 (Learning Rate)

AI 모델을 얼마나 빠르게 학습할지 정하는 부분입니다. 학습률이 너무 높으면 학습이 빠르게 진행되지만 최적의 값을 찾지 못할 수 있고, 너무 낮으면 느리게 진행되지만 최적의 값을 찾을 수 있습니다. 기본값은 0.001입니다.

조기 종료 (Early Stopping)와 Patience

검증 loss가 Patience(기본 10)번의 에포크 동안 나아지지 않으면 학습 횟수를 다 채우기 전에 멈추고, 검증 loss가 가장 낮았던 에포크의 모델로 되돌립니다. 검증 데이터는 행이 20개 이상일 때 떼어 두므로, 그보다 작은 표는 끝까지 학습합니다.

📈 결과보기

결과 UI를 보려면 학습하기 버튼을 클릭하세요.

학습 완료 화면

학습이 끝나면 위 상자에 예측 화면이 열립니다. 열 설정 아래에 있던 모델 그림과 같은 모양이고, 왼쪽이 입력 카드, 오른쪽이 출력 카드입니다.

새로운 글 입력

입력 카드의 글 칸에 새 글을 넣으면 아래에 토큰 칩이 나옵니다. 파란 칩은 사전에 있는 토큰, 회색 칩은 사전에 없어 모르는 토큰 자리로 들어가는 토큰입니다. 문장 길이를 넘는 뒷부분은 흐리게 표시되고 모델에 들어가지 않습니다.

예측하기

예측하기 버튼을 누르면 글이 토큰 순서대로 모델에 들어가고, 출력 카드에 결과가 나옵니다. 분류는 고른 종류와 종류별 확률 막대, 회귀는 예측값입니다.

어텐션 그물과 Q, K, V

가운데 어텐션 상자의 그물은 이 글을 예측할 때의 실제 어텐션 가중치로 굵기가 바뀝니다. 번호가 적힌 토큰 자리에 마우스를 올리면 그 자리의 Q, K, V 값과 어느 자리를 많이 봤는지가 나옵니다. 어텐션 상자 위 띠의 색 칩이 헤드입니다.

학습 결과 그래프

예측 화면 아래에 에포크마다의 학습 loss와 검증 loss 그래프가 나옵니다. loss는 0에 가까울수록 좋습니다. 검증 loss가 다시 오르면 과적합이니 학습 횟수를 그 지점까지 줄이거나 데이터를 늘려 보세요.

저장하기

로그인하면 저장하기 버튼이 켜집니다. 모델 이름, 설명, 데이터 출처, 썸네일, 공개 여부를 적어 저장하면 공유 주소가 생기고, 그 주소로 들어온 누구나 저장된 모델로 예측해 볼 수 있습니다. 공개로 저장한 모델은 만들기 목록의 공유 프로젝트에도 나옵니다.

코랩 실행

학습에 쓴 데이터를 시트 하나짜리 엑셀로 내려받아 파이썬에서 직접 다뤄 볼 수 있습니다. 같은 모델을 파이썬으로 만드는 노트북은 여기서 내려받아 구글 코랩에 올려 쓰면 됩니다.

데이터 편집하기

학습이 끝나면 표 위에 덮개가 생깁니다. 데이터 편집하기 버튼을 누르면 덮개가 걷혀 표를 바꾸고 다시 학습할 수 있습니다.