Cheat Sheet

Text Analytics Toolbox 시작하기

다양한 문서 유형으로부터 잠재 정보를 추출하는 의미 기반 텍스트 마이닝 과정

Text Analytics Toolbox™는 텍스트 데이터의 전처리, 분석 및 모델링을 위한 알고리즘과 시각화 기능을 제공합니다. 이 툴박스로 만든 모델은 감성 분석, 예측 정비 및 토픽 모델링 등의 응용 분야에 사용할 수 있습니다.

함수 이름 설명
wordcloud bag-of-words 또는 LDA 모델로부터 워드 클라우드 차트 생성
wordCloudCounts 워드 클라우드 생성을 위한 단어 개수 계산
textscatter 텍스트의 2차원 산점도 플롯
textscatter3 텍스트의 3차원 산점도 플롯
heatmap 히트맵 차트 생성
histcounts 히스토그램 Bin 도수
discretize 데이터를 Bin이나 범주로 그룹화
워드 클라우드

시각화

워드 클라우드와 텍스트 산점도 플롯을 사용해 결과를 요약하고 검증할 수 있습니다.

비지도 학습

모델링 및 예측

bag-of-words 또는 사전 훈련된 단어 임베딩 모델을 사용해 텍스트를 숫자 표현으로 변환하고 예측 및 토픽 모델링에 특화된 머신러닝 알고리즘을 적용할 수 있습니다.

함수 이름 설명
readWordEmbedding 텍스트 파일로부터 단어 임베딩 읽어오기
trainWordEmbedding 단어 임베딩 훈련
word2vec/vec2word 단어를 임베딩 벡터로 매핑
ldaModel LDA(잠재 디리클레 할당) 모델
lsaModel LSA(잠재 의미 분석) 모델
bagOfWords Bag-of-words 모델
fitlda LDA(잠재 디리클레 할당) 모델 피팅
fitlsa LSA(잠재 의미 분석) 모델 피팅
predict 문서의 상위 LDA 토픽 예측
fitdist 확률 분포 객체를 데이터에 피팅
fitrlinear 선형 회귀 모델을 고차원 데이터에 피팅
fitclinear 선형 분류 모델을 고차원 데이터에 피팅
fitcecoc 분류기에 대해 다중클래스 모델 피팅
함수 이름 설명
extractFileText PDF, Microsoft Word, 일반 텍스트로부터 읽어오기
textscan 파일 또는 문자열로부터 서식 지정된 데이터 읽어오기
readtable 파일에서 테이블 생성
compose 데이터를 서식 지정된 string형 배열로 변환
xlsread Microsoft Excel 스프레드시트 파일 읽어오기
webread RESTful 웹 서비스에서 콘텐츠 읽어오기
TabularTextDatastore 테이블 형식 텍스트 파일의 데이터저장소
FileDatastore 사용자 지정 파일 리더가 포함된 데이터저장소
SpreadsheetDatastore 스프레드시트 파일의 데이터저장소
PDF, 텍스트 파일 및 스프레드시트 아이콘

가져오기

Microsoft® Word® 파일, PDF, 텍스트 파일, 스프레드시트로부터 텍스트를 추출할 수 있습니다.

텍스트 전처리

전처리

일반적인 단어, 구두점, URL과 같이 덜 유용한 아티팩트를 제거하고 텍스트 정규화를 적용해 단어를 어간 형태로 변환할 수 있습니다.

함수 이름 설명
tokenizedDocument 문서를 단어 모음으로 분할
normalizeWords Porter 스테머를 활용해 단어에서 굴절형 제거
bagOfWords Bag-of-words 모델
stopWords 불용어 목록
context 문서에서 특정 단어가 발생하는 문맥 검색
removeWords 선택한 단어를 문서 또는 bag-of-words에서 제거
removeLongWords 긴 단어를 문서 또는 bag-of-words에서 제거
removeShortWords 짧은 단어를 문서 또는 bag-of-words에서 제거
removeInfrequentWords Bag-of-words 모델에서 발생 빈도가 적은 단어 제거
erasePunctuation 텍스트 및 문서에서 구두점 삭제
함수 이름 설명
str = "Hello, world" string형 변수 선언
str = ["Hello","World"] string형 배열 선언
str = string(C) 문자형 벡터 C를 string형으로 변환
str2double 문자열을 배정밀도 숫자로 변환
strlength 문자열의 길이 반환
isstring 입력값이 string형 배열인지 판별
join 문자열 결합
split 문자열 배열에서 문자열 분할
splitlines 새 줄 문자에서 문자열 분할
replace 문자열 배열에서 부분문자열 찾기 및 바꾸기
contains 문자열에 패턴이 있는지 확인
erase 문자열 내에 있는 부분문자열 삭제
extractBetween 표시자 사이의 부분문자열 추출
extractAfter 지정 위치 이후의 부분문자열 추출
extractBefore 지정 위치 이전의 부분문자열 추출
strcmp 문자열 비교
regexp 정규 표현식 패턴과 일치하는 문자열 찾기 (대/소문자 구분)
"Hello,world"

string형

텍스트 데이터를 효율적으로 조작하고 비교하며 저장할 수 있습니다.