이 가이드에서는 글 데이터 준비부터 열 설정, 학습, 예측, 저장과 공유까지 모든 과정을 쉽게 따라할 수 있도록 설명합니다.
"텍스트 분류"는 글을 읽고 그 글이 어떤 종류인지 고르거나(분류), 글에 어울리는 숫자를 맞히는(회귀) AI 모델을 만드는 콘텐츠입니다.
예를 들어 영화 리뷰를 읽고 "긍정"인지 "부정"인지 고르거나, 상품 리뷰를 읽고 별점 1~5점을 맞히는 식입니다. 문자 메시지가 스팸인지, 인터넷 주소가 가짜 사이트인지도 같은 방법으로 배울 수 있습니다.
입력 데이터: AI가 읽을 글입니다. 리뷰, 문의 글, 문자 메시지처럼 한 칸에 글 하나가 들어갑니다. 글 열은 최대 2개까지 쓸 수 있습니다.
출력 데이터: AI가 맞힐 값입니다. "긍정/부정", "배송/환불/계정/기타"처럼 종류면 분류로, 별점이나 점수처럼 숫자면 회귀로 배웁니다. 출력 열이 여러 개면 분류와 회귀를 섞어 한 모델로 배웁니다.
모델은 글을 토큰(낱말 조각)으로 잘라 순서대로 읽는 작은 트랜스포머입니다. 토큰마다 벡터로 바꾼 뒤 어텐션이 토큰끼리 서로 보며 문맥을 섞고, 그 결과를 모아 출력 열마다 답을 냅니다. ChatGPT처럼 글을 만들지는 않고, 읽어서 고르기만 합니다.
아래는 실제 페이지와 똑같이 움직이는 화면입니다. 예제 "영화 리뷰 감정 분류"가 들어 있으니 학습하기 버튼을 눌러 예측까지 따라가 보세요.
💬 AI로 빠르게 시작
원하는 데이터를 입력하면 AI가
글과 결과를 자동으로 만들어드립니다!
엑셀 파일 업로드
시트 하나에 글 열과 결과 열을 함께 넣어 올리세요
예제 불러오기
리뷰 감정, 문의 분류, 별점, 스팸 문자, 가짜 사이트 예제를 바로 열어볼 수 있어요
⚠️ 엑셀 형식: 시트 하나만 씁니다 (원인/결과 두 시트는 자동으로 합쳐요)
첫 행은 열 이름, 첫 열은 항목(이름)입니다
글은 한 칸에 최대 200자, 빈칸은 안 됩니다
열은 항목 열을 빼고 최대 20개, 행은 최대 999개
🧩 표가 올라오면 열마다 입력 / 출력 / 제외를 고릅니다.
입력은 텍스트 열만 (최대 2개), 나머지 열은 출력이에요.
🔎 글은 토큰으로 쪼갠 뒤, 학습 글에 나온 토큰을 많이 나온 순서로 모아 사전을 만들어요. 한 번만 나온 토큰도 담아요.
글을 사전 번호의 줄로 바꿔 작은 트랜스포머에 넣습니다. 토큰마다 임베딩 벡터가 되고, 어텐션이 낱말 순서와 문맥을 봅니다.
🎯 출력 열마다 분류(긍정/부정 같은 종류 고르기)인지 회귀(별점 같은 숫자 예측)인지 정해요.
출력이 여러 개면 분류와 회귀를 섞어도 한 모델로 배웁니다.
설정이 끝나면 페이지 아래의버튼을 눌러주세요!
학습이 끝나면 새 글을 넣어 예측하고
모델을 “저장, 공유”할 수 있습니다
톱니바퀴에서 문장 길이, 임베딩 차원, 헤드와 블록 수, 학습 횟수를 조정할 수 있어요
모델 크기는 10MB 안에서 만들어집니다. 넘으면 사전 크기를 줄여주세요
항목 | 글 | 결과 |
|---|---|---|
페이지 상단에 텍스트 분류 기능을 설명하는 제목이 표시됩니다.
제목 오른쪽 아래의 "간단 사용법"을 누르면 데이터 준비부터 학습까지의 흐름이 한 장으로 펼쳐집니다. 다시 누르면 접힙니다.
입력 칸에 "영화 리뷰로 긍정 부정 감정 분류"처럼 만들고 싶은 데이터를 적고 보내면 AI가 글 열과 결과 열을 갖춘 표를 만들어 아래 표에 넣어 줍니다. 만드는 동안 진행 상황이 화면에 흐릅니다.
예: 고객 문의 글로 담당 부서와 긴급도 예측예제 버튼을 누르면 브라우저에서 바로 표가 만들어집니다. 영화 리뷰 감정, 고객 문의 분류, 상품 리뷰 별점, 문자 스팸, 가짜 사이트 탐지 예제가 있고, 네이버 영화 리뷰 500개와 999개 엑셀은 실제 리뷰 파일을 받아 넣습니다. "더 많은 예제 보기"는 다른 사람이 공유한 프로젝트 목록을 엽니다.
점선 상자를 누르거나 엑셀 파일을 끌어다 놓으면 표에 올라갑니다. 올라간 뒤에는 상자에 파일명이 표시됩니다.
예: 영화 리뷰 감정 분류.xlsx올라온 데이터를 보여 주는 표입니다. 첫 열은 항목(이름), 나머지가 데이터 열입니다. 이 페이지의 표는 엑셀, 예제, AI 생성으로만 채우고 칸을 직접 고치지는 않습니다. 값을 바꾸려면 표 아래의 다운로드 버튼()으로 엑셀을 받아 고친 뒤 다시 올려 주세요. 표 아래에는 행 수가 나옵니다.
열마다 세로줄이 역할 색으로 칠해집니다. 파란 줄은 입력(글), 주황 줄은 출력, 회색 줄은 제외한 열입니다.
데이터 표 아래에 열마다 역할과 종류를 정하는 표가 나옵니다. 처음에는 자동으로 추정해 두고, 언제든 바꿀 수 있습니다. 오른쪽 위의 "자동 추정으로 되돌리기"를 누르면 처음 값으로 돌아갑니다.
열 설정 표 아래에 지금 설정으로 만들어질 모델이 그려집니다. 입력 카드에서 토큰 자리, 어텐션 상자, 자리 평균, 은닉층을 지나 출력 카드로 이어지고, 오른쪽 위에 파라미터 수와 모델 크기가 나옵니다. 그림의 어느 부분에든 마우스를 올리면 그 부분이 하는 일이 나옵니다.
준비한 글 데이터로 AI 모델을 학습시키는 버튼입니다.
문장 길이, 임베딩 차원, 헤드와 블록 수, 학습 횟수 같은 설정을 조정할 수 있는 영역입니다. 자세한 설명은 아래 학습하기 절에 있습니다.
텍스트 분류를 잘 학습하려면 글과 답이 짝지어진 데이터가 충분히 있어야 합니다.
아래는 데이터를 모으는 세 가지 방법입니다.
AI로 만들기
설문지 또는 엑셀 파일 활용
구글 스프레드시트 활용
엑셀 또는 구글 스프레드시트에 입력할 때는 다음 규칙을 따라야 합니다
시트 구성
글 열
결과 열
크기와 빈칸
예시
| 항목 | 리뷰 | 감정 |
|---|---|---|
| 1 | 배우들 연기가 살아 있고 마지막 장면이 오래 남는다 | 긍정 |
| 2 | 이야기가 늘어지고 중간에 졸았다 | 부정 |
| 3 | 기대 없이 봤는데 웃다가 끝났다 | 긍정 |
파일 업로드
사용자가 준비한 글을 바탕으로 AI 모델이 학습하여 결과를 예측하는 과정입니다.
학습은 브라우저 안에서 돌아가므로 글이 밖으로 나가지 않습니다. 사용자는 결과만 확인하면 됩니다.
학습하기 버튼을 누르면 먼저 글을 토큰으로 나누는 토크나이저(약 2.3MB)를 받고, 학습 글에 나온 토큰으로 사전을 만든 뒤 학습이 시작됩니다. 학습 중에는 상단에 진행률 막대가 표시되고, 끝나면 예측 화면이 열립니다.
학습하기 버튼 옆의 톱니바퀴를 누르면 설정 창이 열립니다. 적용한 설정은 다음 학습하기부터 쓰이고, 이미 학습한 모델이 있으면 창 위에 지금 모델의 설정이 나옵니다. 모델은 10MB 안에서 만들어지며, 넘으면 임베딩 차원이나 블록 수를 줄이거나 열 설정에서 사전 크기를 줄여 주세요.
글 하나에서 토큰을 몇 개까지 모델에 넣을지 정합니다. 넘는 뒷부분은 버리고, 모자라면 빈칸으로 채웁니다. 한국어는 글자 하나가 토큰 1~2개쯤 됩니다. 값 미리보기의 평균 글자 수를 보고 고르세요. 길수록 학습이 느려집니다.
토큰 하나를 몇 개의 숫자로 나타낼지 정합니다. 어텐션 블록의 폭이기도 합니다. 클수록 표현이 풍부하지만 모델이 커지고, 데이터가 적으면 외우기 쉽습니다.
어텐션을 몇 갈래로 나눠 볼지 정합니다. 헤드마다 임베딩 차원을 나눠 가지며(차원 / 헤드 수) 서로 다른 관계를 봅니다. 파라미터 수는 바뀌지 않습니다.
어텐션 블록을 몇 개 쌓을지 정합니다. 많을수록 복잡한 패턴을 학습할 수 있지만 느려지고 과적합 위험이 있습니다.
입력한 데이터 전체를 몇 번 반복하여 학습할지 정하는 부분입니다. 글 데이터는 금방 외워서, 글이 많은 표는 10번 안에 검증 loss가 다시 오르고(과적합) 100행쯤의 작은 표는 40번은 돌아야 배웁니다. 그래서 기본값은 40번에 조기 종료를 켠 것입니다.
입력한 데이터 전체를 얼마큼 작은 부분으로 쪼개서 학습할지 정하는 부분입니다. 예를 들어 전체 데이터가 1000개이고 배치 크기가 100일 경우, 한 번에 100개의 데이터로 학습하게 됩니다. 배치 크기가 작을수록 모델이 더 자주 학습하고, 클수록 메모리를 더 씁니다. 기본값은 16입니다.
AI 모델을 얼마나 빠르게 학습할지 정하는 부분입니다. 학습률이 너무 높으면 학습이 빠르게 진행되지만 최적의 값을 찾지 못할 수 있고, 너무 낮으면 느리게 진행되지만 최적의 값을 찾을 수 있습니다. 기본값은 0.001입니다.
검증 loss가 Patience(기본 10)번의 에포크 동안 나아지지 않으면 학습 횟수를 다 채우기 전에 멈추고, 검증 loss가 가장 낮았던 에포크의 모델로 되돌립니다. 검증 데이터는 행이 20개 이상일 때 떼어 두므로, 그보다 작은 표는 끝까지 학습합니다.
결과 UI를 보려면 학습하기 버튼을 클릭하세요.
학습이 끝나면 위 상자에 예측 화면이 열립니다. 열 설정 아래에 있던 모델 그림과 같은 모양이고, 왼쪽이 입력 카드, 오른쪽이 출력 카드입니다.
입력 카드의 글 칸에 새 글을 넣으면 아래에 토큰 칩이 나옵니다. 파란 칩은 사전에 있는 토큰, 회색 칩은 사전에 없어 모르는 토큰 자리로 들어가는 토큰입니다. 문장 길이를 넘는 뒷부분은 흐리게 표시되고 모델에 들어가지 않습니다.
예측하기 버튼을 누르면 글이 토큰 순서대로 모델에 들어가고, 출력 카드에 결과가 나옵니다. 분류는 고른 종류와 종류별 확률 막대, 회귀는 예측값입니다.
가운데 어텐션 상자의 그물은 이 글을 예측할 때의 실제 어텐션 가중치로 굵기가 바뀝니다. 번호가 적힌 토큰 자리에 마우스를 올리면 그 자리의 Q, K, V 값과 어느 자리를 많이 봤는지가 나옵니다. 어텐션 상자 위 띠의 색 칩이 헤드입니다.
예측 화면 아래에 에포크마다의 학습 loss와 검증 loss 그래프가 나옵니다. loss는 0에 가까울수록 좋습니다. 검증 loss가 다시 오르면 과적합이니 학습 횟수를 그 지점까지 줄이거나 데이터를 늘려 보세요.
로그인하면 저장하기 버튼이 켜집니다. 모델 이름, 설명, 데이터 출처, 썸네일, 공개 여부를 적어 저장하면 공유 주소가 생기고, 그 주소로 들어온 누구나 저장된 모델로 예측해 볼 수 있습니다. 공개로 저장한 모델은 만들기 목록의 공유 프로젝트에도 나옵니다.
학습에 쓴 데이터를 시트 하나짜리 엑셀로 내려받아 파이썬에서 직접 다뤄 볼 수 있습니다. 같은 모델을 파이썬으로 만드는 노트북은 여기서 내려받아 구글 코랩에 올려 쓰면 됩니다.
학습이 끝나면 표 위에 덮개가 생깁니다. 데이터 편집하기 버튼을 누르면 덮개가 걷혀 표를 바꾸고 다시 학습할 수 있습니다.