빅데이터 분석은 크게 세 단계로 구분 될 수 있으며, 각 분석 단계마다 세부적으로 3~4개의 하위 과정이 있다.
빅데이터의 분석 과정은 각 단계마다 정확한 결과를 얻을 때까지 반복을 거치고 각 단계가 진행될 때마다 결과가 제대로 나오지 않을 경우 다시 전 단계를 반복해야 하는 연속 공정이다.
1단계: 빅데이터 사전 처리 및 특정 변수 식별
분석 목적에 맞는 가설을 수립하고 각 가설을 입증하는 데 필요한 분석변수를 기업 내에 있는 데이터에서 찾아보고 외부 데이터가 필요한 경우 확보하는 과정
데이터에 포함되어 있을 수 있는 노이즈나 유효하지 않은 데이터들을 제거하는 기초적인 데이터베이스 클렌징 후, 분석변수와 케이스의 수를 비교하여 차원의 저주 발생 여부를 점검하고, 분석하는 데 필요한 크기의 데이터를 수집하는 과정
기존 분석변수들 간에 존재하는 관계를 데이터 시각화 기법으로 분석하고 비즈니스의 의미를 상실하지 않은 새로운 특징변수를 추출해낸 후 학습을 위한 충분한 케이스 데이터들을 수집하는 과정
2단계: 알고리즘 선정 및 학습
식별된 특징변수 중 분석에 사용할 만큼 충분한 케이스 데이터를 확보한 특징변수를 최종 확정하고 분석 목적에 맞는 머신러닝 알고리즘을 선정하는 과정
선정된 알고리즘의 매개변수를 조정하거나 보완하는 과정
특징변수를 포함한 빅데이터 분석 데이터 세트를 활용하여 알고리즘을 학습시키는 과정
학습된 알고리즘에 향후 노이즈가 심한 데이터가 입력되더라도 오류 발생 가능성을 최소화할 수 있도록 학습된 알고리즘의 노이즈 등에 대한 민감도 등을 테스트하는 과정
3단계: 학습된 알고리즘에서 업무 규칙 추출
학습된 알고리즘에서 인간이 이해할 수 있는 규칙을 추출하기 위해 적합한 규칙 추출Rule Extraction 알고리즘을 찾는 과정
추출된 규칙들을 인간이 이해하고 관리할 수 있도록 충돌이나 중복 등을 제거하여 최소한의 규칙으로 축소하는 과정
추출된 규칙이 학습된 결과를 충실히 반영하는지 확인하는 과정
전문가 시스템 Expert System 처럼 학습된 알고리즘이 어떻게 결론에 도달했는지를 분석 담당자나 업무 담당자가 이해 할 수 있도록 전문가 시스템에서 주로 많이 사용하는 IF-THEN 형태로 알고리즘의 학습 결과를 변환시켜주는 단계이다. 전문가 시스템에서 사용하는 규칙은 전문가들의 지식을 시스템에 포함시키기 쉽다는 장점이 있다. 하지만 전문가들이 제시한 규칙이 상호 충돌하거나 중복되어 불필요한 규칙이 도출되면 발견하기가 어렵고, 하나의 규칙이 변경될 때 변경된 규칙이 전체 규칙들에 미치는 영향을 파악하기 어렵다는 단점도 존재한다. 특히 전문가 시스템에 내장되어 있는 규칙의 수가 많은 경우 새로운 규칙이 발견되었을 때 기존에 사용하던 규칙 세트에 대한 관리와 업데이트가 쉽지 않다. 이런 단점을 극복할 수 있도록 머신러일 알고리즘으로부터 업무 규칙을 추출하는 것이 주된 목적이다.
비용은 줄이고 매출은 올리는 비즈니스 전략
- 돈이 보이는 빅데이터, 이종석 -
Posted from my blog with SteemPress : http://internetplus.co.kr/wp/?p=387