| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
- 운영체제 서비스
- 운영체제 목적
- 레지스터
- 겁나 많아
- 프로그래밍
- 뿌..
- 선택
- 운영체제의 기능 1. 자원 관리 기능 2. 시스템 보호 3. 네트워크(통신 기능)
- 앨런 튜링
- 운영체제의 미래
- 소프트웨어
- 패킷트레이서 이용
- 미래 사회의 단위
- 절차적 사고의 장점
- 처리
- gensim 3.7.3 설치 오류
- 해결 방안
- 순서도
- 운영체제의 발달 과정
- 딥러닝
- 장치에 할당할 수 없는 NET ID Broadcast주소
- 반복 구조 찾기
- 기계어
- 출력
- 공부정리
- 소프트웨어 시대
- 절차적 사고
- 말 인용
- 컴퓨터
- 국립과천과학관
- Today
- Total
목록전체 글 (568)
hye-_
교차검증 모델의 성능을 높이기 위해 데이터 파라미터(가중치)를 확인하고 하이퍼파라미터(모델의 설정값)를 튜닝하는 과정을 거쳐 결과를 비교해야 하는데, 이때 테스트 데이터를 반복해서 재사용하면 학습 데이터의 일부가 되는 셈이고 모델 과적합의 원인이 된다.머신러닝 모델의 성능을 향상시키기 위해 두 가지 요소인 파라미터(가중치)와 하이퍼파라미터(설정값)를 조정해야 한다는 것을 말하고 있으며, 특히 테스트 데이터를 여러 번 사용하면 그 데이터가 사실상 학습에 영향을 주게 되어 과적합이 발생한다는 위험을 설명하는 문장이다. 즉, 평가용 데이터가 학습에 개입하면 모델이 실제 성능보다 좋게 보이는 착각이 생긴다는 것을 의미한다. 왜?모델은 원래 보지 못한 데이터에 대해서도 잘 예측해야 하는 일반화 능력이 중요하다. ..
① ROC Curve(수신자 판단 특성 곡선)와 AUC(Area Under the ROC Curve)ROC Curve(Receiver Operator Characteristic Curve)는 민감도와 특이도를 이용하여 그린 그래프로 가로축은 거짓 양성비율(FPR, 1 - 특이도), 세로축은 참 양성비율(TPR, = 민감도 = 재현율)로 구성된다.ROC Curve는 이진분류(binary classification) 모델이 임계값(threshold)을 바꿀 때 성능이 어떻게 달라지는지를 보여주는 그래프이며, 가로축에는 거짓 양성비율(FPR), 세로축에는 참 양성비율(TPR) 을 놓는다. 즉 실제로는 음성인데 양성이라고 잘못 판단하는 비율과, 실제 양성인 것 중 올바르게 양성으로 맞히는 비율 사이의 관계를 시..
평가지표모델 평가는 최종 분석 모델의 신뢰성을 입증하여 모델의 타당성을 확보하고자 수행하는 절차이며, 모델 진단은 분석 모델의 불완전성을 파악하여, 이를 개선함으로써 최선의 모델을 얻고자 수행하는 절차이다.모델 평가와 모델 진단의 차이, 평가라는 것은 이미 완성된 최종 모델이 얼마나 믿을 수 있는지를 검증하는 과정이고, 진단이라는 것은 모델이 완벽하지 않다는 전제 하에 문제점을 찾아내고 그것을 개선하여 더 좋은 모델을 만들기 위한 과정이라는 것을 의미한다. 즉 평가=검증, 진단=개선 과정이라고 이해해야 한다. 왜왜 이렇게 나누냐면, 데이터 분석 모델은 한 번에 완벽하게 만들어지는 것이 아니라 반복적인 수정과 개선 과정을 통해 점점 좋아지기 때문이다. 그래서 먼저 모델을 만들고 → 문제를 찾고(진단) → ..
모수 통계와 비모수 통계모집단의 특성에 대한 정보(분포의 형태와 모수에 대한 사전정보)가 충분하고 변수의 척도가 등간척도나 비율측도로 측정된 경우 적용될 수 있는 통계 분석 방법을 모수 통계 또는 모수 검정이라 정의하며, 모집단의 분포 형태나 모수에 대한 정보가 부족해 모집단의 특성에 대한 가정을 세우기 어렵거나 자료의 척도가 명목척도, 서열척도인 경우 적용되는 통계 분석 방법을 비모수 통계또는 비모수 검정이라 정의한다.의미통계 분석을 크게 두 가지로 나누는 기준. 즉, 데이터의 분포 형태나 모수(평균, 분산 등)에 대한 정보가 충분하고 수치형 데이터일 경우에는 모수 통계를 사용하고, 반대로 분포에 대한 정보가 부족하거나 순서/범주형 데이터일 경우에는 비모수 통계를 사용한다는 전체 구조를 정의왜?통계 분..
앙상블분석 앙상블분석은 주어진 데이터로부터 여러 개의 모델을 학습한 다음, 분류나 회귀 결과를 예측할 때, 여러 모델의 예측 결과들을 종합하여 정확도를 높이는 기법이다.앙상블분석은 하나의 모델만 사용하는 것이 아니라 동일한 데이터에서 여러 개의 모델을 각각 따로 학습시킨 뒤, 새로운 데이터가 들어왔을 때 각각의 모델이 낸 결과를 하나로 합쳐 최종 결과를 만드는 방식이다. 즉, 여러 모델이 각자 판단한 결과를 모아서 하나의 더 신뢰도 높은 결과를 만드는 방법이며, 단일 모델이 가질 수 있는 편향이나 오류를 줄이고 전체적인 예측 성능을 향상시키기 위한 전략이다. 이 과정에서 모델 간의 다양성이 확보될수록 결과의 안정성과 정확도가 더욱 높아지는 특징을 가진다. 왜 왜 여러 개의 모델을 사용하는가에 대한 이유는..
비정형 데이터 분석 데이터의 유형인 정형/반정형/비정형 데이터 관점에서 영상, 음성, 문서 등 정의된 형태가 없는 비정형 데이터의 잠재적 가치가 가장 높다고 할 수있다.데이터를 형태 기준으로 나눌 때 정형(Structured), 반정형(Semi-Structured), 비정형(Unstructured) 데이터 중에서 영상, 음성, 문서처럼 구조가 정해져 있지 않은 데이터가 가장 높은 가치를 가진다는 의미이다. 즉, 표처럼 깔끔하게 정리된 데이터보다 오히려 자유로운 형태의 데이터가 더 많은 정보를 담고 있고 활용 가능성이 크다는 것을 강조하는 문장이다. 왜왜냐하면 정형 데이터는 이미 사람이 구조를 정해놓은 상태라 정보가 제한되어 있지만, 비정형 데이터는 사람의 행동, 감정, 맥락, 패턴 등 더 풍부한 의미를 ..
딥러닝분석 인공신경망(ANN)은 입력값을 이용하여 출력값을 계산하고, 계산한 출력값과 사용자가 기대하는 출력값을 비교하게 되는데, 이때 기대하는 출력값을 생성할 수 있도록 가중치를 조절한다.인공신경망이 데이터를 받아서 결과를 만들고, 그 결과가 정답과 얼마나 다른지를 비교한 뒤 그 차이를 줄이기 위해 내부의 가중치를 계속 수정하는 학습 구조다. 즉, 단순 계산이 아니라 "틀린 만큼 수정하면서 점점 맞춰가는 구조"라는 핵심을 담고 있다. 왜?왜 이렇게 하냐면, 처음에는 신경망이 아무것도 모르는 상태라서 입력을 넣어도 거의 랜덤한 출력이 나오는데, 이 상태에서 그냥 두면 절대 정답에 가까워지지 않기 때문이다. 그래서 출력과 정답의 차이(오차, error)를 기준으로 "어느 방향으로 가중치를 바꾸면 더 정답에..
나이브 베이즈 나이브 베이즈는 베이즈 정리를 바탕으로 임의의 데이터가 주어졌을 때 특정 범주(클래스)로 예측될 확률을 계산하는 분류 모델이다.의미 →나이브 베이즈는 어떤 데이터가 들어왔을 때, 이 데이터가 어떤 클래스에 속할지를 확률적으로 계산하는 모델이며, 그 핵심 원리는 베이즈 정리를 기반으로 과거 정보와 현재 데이터를 결합하여 가장 가능성이 높은 결과를 선택하는 방식이다.왜 →현실에서는 데이터가 어떤 그룹에 속하는지 명확하지 않은 경우가 많기 때문에, 단순 규칙이 아니라 확률을 기반으로 판단해야 더 유연하고 정확한 예측이 가능해지며, 베이즈 정리는 사전 정보와 관측 데이터를 결합할 수 있는 가장 대표적인 확률적 도구이기 때문에 사용된다.용어뜻 →나이브(Naive): 순진하다는 뜻으로, 복잡한 관계를..
베이지안분석 확률은 어떤 일이 발생할 가능성(경우의 수)의 척도를 의미하며, 비슷한 현상이 반복해서 일어날 경우에 어떤 사건이 발생할 가능성을 0과 1 사이의 숫자 혹은 0% ~ 100%의 비율로 표현한 값이다.의미 →확률이라는 개념은 단순히 "일어날 수도 있다"라는 감각적인 표현이 아니라, 어떤 사건이 실제로 발생할 가능성을 수치로 정량화하여 나타내는 도구라는 의미이다. 특히 동일하거나 유사한 상황이 여러 번 반복되는 환경에서, 특정 사건이 얼마나 자주 발생하는지를 기준으로 그 가능성을 측정하고 이를 0과 1 사이의 숫자 또는 퍼센트 형태로 표현하는 것을 말한다.왜 →왜 확률을 0과 1 사이로 표현하냐면, 0은 절대 발생하지 않는 사건을 의미하고 1은 반드시 발생하는 사건을 의미하기 때문에, 모든 사건..
시계열 데이터 시계열 데이터는 시간별(Hourly), 일별(Daily), 월별(Monthly), 분기별(Quarterly) 또는 연도별(Annual) 등 시간의 경과에 따라 순서대로(Ordered in Time) 관측되는 자료이다.의미시간이라는 축(Time Axis)을 기준으로 데이터가 순서대로 쌓여 있는 자료를 의미하며, 데이터의 핵심은 값 자체보다 "시간 순서"가 중요하다는 특징을 가진다.왜?일반 데이터는 순서가 바뀌어도 의미가 크게 변하지 않지만, 시계열 데이터는 순서가 바뀌면 원인과 결과 관계가 완전히 뒤집히기 때문에 분석 자체가 불가능해진다. 예를 들어 어제 → 오늘 → 내일 순서를 바꾸면 미래가 과거가 되는 말이 안 되는 상황이 발생하기 때문에 시간 순서가 반드시 유지되어야 한다.용어뜻시계열(..
다변량분석 다변량분석이란 여러 현상이나 사건에 대한 측정값을 개별적으로 분석하지 않고, 동시에 분석하는 통계 기법을 말한다.의미여러 개의 변수 데이터를 따로따로 보는 것이 아니라 한 번에 묶어서 함께 분석하는 방법이다.왜현실의 데이터는 하나의 변수만으로 설명되지 않고 여러 요인이 동시에 영향을 주기 때문에, 개별적으로 분석하면 변수 간 상호작용이나 숨겨진 관계를 놓칠 가능성이 매우 크다. 따라서 동시에 분석해야 실제 현상에 가까운 해석이 가능해지고, 더 정확한 예측과 인과 해석이 가능해진다.용어뜻다변량분석(Multivariate Analysis): 여러 개 변수의 관계를 동시에 분석하는 통계 방법측정값(Measurement): 관찰이나 실험을 통해 얻은 수치 데이터예시키, 몸무게, 운동량, 식습관을 동시..
범주형 자료 분석 범주형 자료 분석은 독립변수 혹은 종속변수가 범주형 변수인 경우 데이터를 분석하여 모델의 유의성을 분석하는 방법이다.범주형 자료 분석은 데이터 안에 들어있는 변수 중에서 입력(독립변수)이나 결과(종속변수)가 “숫자가 아닌 분류값(카테고리)”일 때, 그 데이터를 가지고 모델이 의미 있는 결과를 내는지 검정하는 분석 방법이다.왜범주형 변수는 숫자처럼 크기 비교(대소 관계)가 의미가 없기 때문에 평균, 분산 같은 일반적인 연속형 통계 기법을 그대로 적용하면 해석이 왜곡된다. 그래서 범주 간의 관계(비율, 빈도, 분포 차이)를 중심으로 분석해야 하며, 이때 모델이 우연이 아니라 실제로 의미 있는 차이를 설명하는지 확인하기 위해 유의성 검정을 수행하는 것이다. 즉, "이 관계가 진짜냐 아니면 우..