Latest Posts
- [sklearn 패키지] train_test_split 함수(데이터 분할) 모델을 훈련하고 성능을 측정하기 위해서는 전체 데이터를 훈련, 검증 및 테스트 데이터 분할하는 작업이 필요하다. 데이터 분할에 대한 구체적인 내용은 아래 포스팅을 참고하길 바란다. sklearn 패키지는 이러한 작업을 효율적으로 수행하는 train_test_split 함수를 제공하고 있다. 본 포스팅에서는 iris 데이터를 사용하여 데이터 분할에 대한 다양한 예시를 살펴보고자 한다. 2022.11.02 - [Machine Learning/데이터 전처리] - [데이터 전처리] 훈련 및 테스트 데이터 분할 iris 데이터 # 라이브러리 로딩 import pandas as pd from sklearn.datasets import load_iris # 데이터 로딩 및 데이터 프레임으로 변환 iris = load.. 2022.11.05
- [데이터 전처리] 교차 검증 교차 검증이란 무엇이고 왜 사용해야 하는가? 데이터 분석에서 널리 사용되는 홀드아웃 검증(Holdout Validation) 방법은 직관적이고 편리하다는 장점이 있다. 이러한 방법은 일반적으로 전체 데이터를 모델 훈련을 위한 훈련 데이터와 모델 성능을 검증하기 위한 테스트 데이터로 분할한다. 그중에서 훈련 데이터의 일부를 분할하여 최적의 파라미터를 탐색하기 위한 검증 데이터로 사용한다. 그러나, 모델 훈련에 사용할 수 있는 훈련 데이터가 작으면 잠재적으로 모델의 정확도를 감소시키는 문제가 발생한다. 반대로 검증 데이터가 지나치게 작으면 모델을 효과적으로 평가하기 어려운 문제가 존재한다. 이를 해결하기 위한 방법으로는 모델을 반복적으로 검증하기 위해 전체 훈련 데이터를 분할하여 여러 개의 훈련 및 검증 데.. 2022.11.04
- [데이터 전처리] 훈련 및 테스트 데이터 분할 훈련 및 테스트 데이터 분할은 무엇을 의미하는가? 일반적으로 전체 데이터를 여러 개 집합으로 분할하고 그중에서 일부는 모델을 훈련할 때 사용하고 나머지는 모델 성능을 평가할 때 사용된다. 본 포스팅은 모델을 구축하고 검증하기 위한 데이터 분할 방법에 중점을 두고 있다. 그럼 데이터 분석에서 데이터 분할은 무엇인가? 일반적으로 데이터 분할은 전체 데이터를 다음과 같은 3개의 집합으로 분할하는 과정을 의미한다. 훈련 데이터: 개발한 모델을 훈련할 때 사용 검증 데이터: 개발한 모델의 최적의 하이퍼 파라미터를 찾을 때 사용 테스트 데이터: 최종 모델의 성능을 평가할 때 사용 훈련 및 테스트 데이터의 역할은 무엇인가? 개발을 완료한 모델에 새로운 데이터를 입력했을 때 일반화된 성능을 나타내는지를 확인하는 가장 .. 2022.11.02
- group_by( ) 와 summarise( ) 함수: 그룹별 요약 데이터 분석 과정에서 월별, 주별 등 그룹별 평균이나 빈도를 계산할 때 group_by( )와 summarise( )함수를 효율적으로 사용할 수 있다. 특히, summarise( ) 함수는 전체 데이터에서 각 변수 혹은 케이스의 값을 요약할 때 사용하기보다는 group_by( ) 함수와 조합해 그룹별 요약 값을 효율적으로 계산할 때 많이 사용하고 있다. 구체적인 계산방법은 아래 예시와 같다. Case 1: summarise( ) 함수를 활용한 각 변수 요약 값 계산 예시: Ozone 변수의 평균을 계산해 Ozone maen이라는 변수명을 할당하여 출력할 경우 Ozone 변수는 결측치를 포함하므로 이를 제외하고 계산하기 위해 na.rm = TRUE를 지정함. > airquality %>% summarise.. 2022.08.11
- mutate( ) 함수: 파생변수 추가 데이터의 기존 변수를 바탕으로 새로운 파생변수를 추가하고자 할 때 mutate( ) 함수를 효율적으로 사용할 수 있다. mutate( ) 함수는 기존 변수를 사용하여 연산을 수행하거나 조건문을 적용하여 분석 목적에 적합한 새로운 변수를 데이터 프레임에 직접적으로 추가할 수 있다. 구체적인 사용방법은 아래 예시와 같다. Case 1: 단일 파생변수 추가 예시: Ozone, Solar.R, Wind 등 3개 변수를 모두 합친 새로운 변수를 추가할 경우 mutate( ) 함수의 괄호 안에 파생변수 이름과 연산자를 입력 > airquality %>% mutate(total = Ozone + Solar.R + Wind) %>% head() Ozone Solar.R Wind Temp Month Day total 1.. 2022.08.09
Popular Posts
- R 기초: R 프로그램 및 R Studio 설치 방법(windows 버전) R를 이용하여 데이터 분석을 하기 위해서는 기본적으로 R Basic 프로그램과 R Studio를 설치해야 한다. 처음 입문하시는 분들은 아래 정리한 내용을 보고 R 프로그램과 R Studio의 차이를 이해하시고 설치를 진행하시길 바란다. ** R이란? R은 오픈소스 프로그램으로 누구나 무료로 다운로드 받아 사용할 수 있음. https://cran.r-project.org/ 또는 https://www.r-project.org/에서 다운로드 받을수 있음. 컴퓨터 운영체제(Windows/Linux/Mac)에 맞는 프로그램을 다운로드 받고 설치를 진행하면 됨. Previous releases를 클릭하면 최신 버전이 아닌, 이전 버전의 R을 다운로드 받아 설치할 수도 있음 (2019년 10월 30일 기준 최신 버.. 2019.10.30
- [데이터 전처리] 교차 검증 교차 검증이란 무엇이고 왜 사용해야 하는가? 데이터 분석에서 널리 사용되는 홀드아웃 검증(Holdout Validation) 방법은 직관적이고 편리하다는 장점이 있다. 이러한 방법은 일반적으로 전체 데이터를 모델 훈련을 위한 훈련 데이터와 모델 성능을 검증하기 위한 테스트 데이터로 분할한다. 그중에서 훈련 데이터의 일부를 분할하여 최적의 파라미터를 탐색하기 위한 검증 데이터로 사용한다. 그러나, 모델 훈련에 사용할 수 있는 훈련 데이터가 작으면 잠재적으로 모델의 정확도를 감소시키는 문제가 발생한다. 반대로 검증 데이터가 지나치게 작으면 모델을 효과적으로 평가하기 어려운 문제가 존재한다. 이를 해결하기 위한 방법으로는 모델을 반복적으로 검증하기 위해 전체 훈련 데이터를 분할하여 여러 개의 훈련 및 검증 데.. 2022.11.04
- group_by( ) 와 summarise( ) 함수: 그룹별 요약 데이터 분석 과정에서 월별, 주별 등 그룹별 평균이나 빈도를 계산할 때 group_by( )와 summarise( )함수를 효율적으로 사용할 수 있다. 특히, summarise( ) 함수는 전체 데이터에서 각 변수 혹은 케이스의 값을 요약할 때 사용하기보다는 group_by( ) 함수와 조합해 그룹별 요약 값을 효율적으로 계산할 때 많이 사용하고 있다. 구체적인 계산방법은 아래 예시와 같다. Case 1: summarise( ) 함수를 활용한 각 변수 요약 값 계산 예시: Ozone 변수의 평균을 계산해 Ozone maen이라는 변수명을 할당하여 출력할 경우 Ozone 변수는 결측치를 포함하므로 이를 제외하고 계산하기 위해 na.rm = TRUE를 지정함. > airquality %>% summarise.. 2022.08.11
- select( ) 함수: 변수 추출 select( ) 함수는 데이터에 포함된 여러 변수(column)에서 일부 변수만 추출할 때 사용한다. 아래 그림과 같이 데이터 프레임에서 일부 변수를 선택할 수 있다. 구체적인 사용법은 아래 예시와 같다. Case 1: 단일 변수 추출 예시: airquality 데이터에서 Ozone 변수를 선택할 경우 ## 처음 5개 행 출력 > airquality %>% select(Ozone) %>% head() Ozone 1 41 2 36 3 12 4 18 5 NA 6 28 Case 2: 여러 변수 추출 예시: Ozone, Month, Day 등 3개 변수를 선택할 경우 > airquality %>% select(Ozone, Month, Day) %>% head() Ozone Month Day 1 41 5 1 2.. 2022.08.08
- [keras 기초] Input layer CNN에서 일반적으로 사용되는 Input layer는 입력 데이터의 크기를 지정해주는 역할을 한다. 예를 들어 아래와 같이 6개의 속성을 가진 데이터가 3개가 있다고 가정한다.(숫자의 임의로 설정한것임) I love data mining very much I love big data very much I love deep learning very much [[ 6, 13, 17, 10, 3, 8], [17, 13, 4, 15, 3, 15], [14, 2, 17, 7, 6, 14]] 위 데이터를 keras 모델에 입렵 데이터로 넣을 경우 아래와 같이 속성의 크기만 입력하면 된다. layer. Input(shape=(6, ) 2019.11.08