Text Analytics Toolbox 시작하기
Text Analytics Toolbox™는 텍스트 데이터의 전처리, 분석 및 모델링을 위한 알고리즘과 시각화 기능을 제공합니다. 이 툴박스로 만든 모델은 감성 분석, 예측 정비 및 토픽 모델링 등의 응용 분야에 사용할 수 있습니다.
| 함수 이름 | 설명 |
|---|---|
wordcloud |
bag-of-words 또는 LDA 모델로부터 워드 클라우드 차트 생성 |
wordCloudCounts |
워드 클라우드 생성을 위한 단어 개수 계산 |
textscatter |
텍스트의 2차원 산점도 플롯 |
textscatter3 |
텍스트의 3차원 산점도 플롯 |
heatmap |
히트맵 차트 생성 |
histcounts |
히스토그램 Bin 도수 |
discretize |
데이터를 Bin이나 범주로 그룹화 |
시각화
워드 클라우드와 텍스트 산점도 플롯을 사용해 결과를 요약하고 검증할 수 있습니다.
| 함수 이름 | 설명 |
|---|---|
readWordEmbedding |
텍스트 파일로부터 단어 임베딩 읽어오기 |
trainWordEmbedding |
단어 임베딩 훈련 |
word2vec/vec2word |
단어를 임베딩 벡터로 매핑 |
ldaModel |
LDA(잠재 디리클레 할당) 모델 |
lsaModel |
LSA(잠재 의미 분석) 모델 |
bagOfWords |
Bag-of-words 모델 |
fitlda |
LDA(잠재 디리클레 할당) 모델 피팅 |
fitlsa |
LSA(잠재 의미 분석) 모델 피팅 |
predict |
문서의 상위 LDA 토픽 예측 |
fitdist |
확률 분포 객체를 데이터에 피팅 |
fitrlinear |
선형 회귀 모델을 고차원 데이터에 피팅 |
fitclinear |
선형 분류 모델을 고차원 데이터에 피팅 |
fitcecoc |
분류기에 대해 다중클래스 모델 피팅 |
| 함수 이름 | 설명 |
|---|---|
extractFileText |
PDF, Microsoft Word, 일반 텍스트로부터 읽어오기 |
textscan |
파일 또는 문자열로부터 서식 지정된 데이터 읽어오기 |
readtable |
파일에서 테이블 생성 |
compose |
데이터를 서식 지정된 string형 배열로 변환 |
xlsread |
Microsoft Excel 스프레드시트 파일 읽어오기 |
webread |
RESTful 웹 서비스에서 콘텐츠 읽어오기 |
TabularTextDatastore |
테이블 형식 텍스트 파일의 데이터저장소 |
FileDatastore |
사용자 지정 파일 리더가 포함된 데이터저장소 |
SpreadsheetDatastore |
스프레드시트 파일의 데이터저장소 |
| 함수 이름 | 설명 |
|---|---|
tokenizedDocument |
문서를 단어 모음으로 분할 |
normalizeWords |
Porter 스테머를 활용해 단어에서 굴절형 제거 |
bagOfWords |
Bag-of-words 모델 |
stopWords |
불용어 목록 |
context |
문서에서 특정 단어가 발생하는 문맥 검색 |
removeWords |
선택한 단어를 문서 또는 bag-of-words에서 제거 |
removeLongWords |
긴 단어를 문서 또는 bag-of-words에서 제거 |
removeShortWords |
짧은 단어를 문서 또는 bag-of-words에서 제거 |
removeInfrequentWords |
Bag-of-words 모델에서 발생 빈도가 적은 단어 제거 |
erasePunctuation |
텍스트 및 문서에서 구두점 삭제 |
| 함수 이름 | 설명 |
|---|---|
str = "Hello, world" |
string형 변수 선언 |
str = ["Hello","World"] |
string형 배열 선언 |
str = string(C) |
문자형 벡터 C를 string형으로 변환 |
str2double |
문자열을 배정밀도 숫자로 변환 |
strlength |
문자열의 길이 반환 |
isstring |
입력값이 string형 배열인지 판별 |
join |
문자열 결합 |
split |
문자열 배열에서 문자열 분할 |
splitlines |
새 줄 문자에서 문자열 분할 |
replace |
문자열 배열에서 부분문자열 찾기 및 바꾸기 |
contains |
문자열에 패턴이 있는지 확인 |
erase |
문자열 내에 있는 부분문자열 삭제 |
extractBetween |
표시자 사이의 부분문자열 추출 |
extractAfter |
지정 위치 이후의 부분문자열 추출 |
extractBefore |
지정 위치 이전의 부분문자열 추출 |
strcmp |
문자열 비교 |
regexp |
정규 표현식 패턴과 일치하는 문자열 찾기 (대/소문자 구분) |