치트시트

내게 맞는 머신러닝 알고리즘은?

데이터와 애플리케이션은 준비되어 있지만, 어떤 알고리즘부터 시도해야 할지 고민되시나요? 어떤 알고리즘을 선택하더라도 장단점은 존재합니다. 시작하는 데 도움이 될 몇 가지 기본 원칙을 소개합니다.

데이터셋의 크기

알고리즘의 성능은 데이터셋 크기에 크게 영향을 받습니다. 50MB 미만 또는 1TB 초과의 데이터셋에 대해 반드시 특정 알고리즘을 사용해야 한다는 절대적인 기준은 없지만, 샘플 데이터셋의 클래스 분포가 균형을 이루고 있다고 가정할 때 데이터의 규모에 따라 우선적으로 고려해 볼 수 있는 알고리즘은 다음과 같습니다.

  • 결정 트리
  • 선형 모델 (로지스틱 회귀 및 선형 판별 분석 포함)

  • (비선형) SVM
  • 나이브 베이즈
  • 최근접이웃
  • (얕은) 신경망

  • 심층 신경망
  • 앙상블

훈련 속도

훈련 속도란 주어진 연산 리소스에서 새로운 모델을 구축하고 학습하는 데 걸리는 시간을 의미합니다. 알고리즘의 구조와 복잡도 등을 비롯한 여러 요인이 모델의 학습 속도에 영향을 미칩니다. 프로젝트에서 훈련 속도가 매우 중요한 요소이고 GPU와 같은 하드웨어 가속기를 사용할 수 없는 경우, 다음 알고리즘을 우선적으로 고려해 볼 수 있습니다.

  • 결정 트리
  • 선형 모델 (로지스틱 회귀 및 선형 판별 분석 포함)
  • 나이브 베이즈

  • 앙상블
  • 최근접이웃
  • (얕은) 신경망

  • (비선형) SVM

  • 심층 신경망

해석 가능성

머신러닝 모델은 직관적이지 않을 수 있으며, 그 동작 방식을 이해하기 어려운 경우가 많습니다. 해석 가능성은 알고리즘의 의사결정 과정이 얼마나 투명하게 설명될 수 있는지를 의미합니다. 그러나 해석 가능성이 높을수록 모델의 성능이나 정확도가 일부 희생되는 경우가 많습니다. 또한 산업 분야와 응용 사례에 따라 해석 가능성에 대한 요구사항이 다를 수 있습니다. 알고리즘 선택을 시작하는 데 도움이 되도록, 각 알고리즘의 해석 용이성을 대략적으로 평가한 기준을 아래에 제시합니다.

  • 결정 트리
  • 선형 모델 (로지스틱 회귀 및 선형 판별 분석 포함)

  • 최근접이웃
  • (얕은) 신경망
  • 나이브 베이즈

  • (비선형) SVM
  • 앙상블
  • 심층 신경망

조정

조정이란 모델의 성능을 최적화하기 위해 파라미터와 하이퍼파라미터를 조정하는 과정입니다. 일부 알고리즘은 조정이 많이 필요하지 않으며, 응용 분야에 맞게 조정할 수 있는 파라미터나 하이퍼파라미터의 수가 제한적입니다. 훈련할 모델 유형을 선택한 후에는 모델 성능에 큰 영향을 미치는 파라미터를 자동으로 조정하여 모델을 최적화할 수 있습니다. 어느 정도까지 조정을 수행하고 싶으신가요?

  • 선형 모델 (로지스틱 회귀 및 선형 판별 분석 포함)
  • 최근접이웃

  • 결정 트리
  • (비선형) SVM
  • 앙상블
  • 나이브 베이즈
  • (얕은) 신경망

  • 심층 신경망