레이블이 메모인 게시물을 표시합니다. 모든 게시물 표시
레이블이 메모인 게시물을 표시합니다. 모든 게시물 표시

2016년 5월 27일 금요일

딥러닝 메모

딥러닝을 이해하기 위해 참조한 내용들을 정리한다.


역사 

사람의 신경망을 본 뜬 인공신경망 기술이 핫 이슈가 된다.
XOR 문제에서 좌절을 안긴다.

(미래에서 온 인류 저항군인) 민스키 교수의 두 마디에 의해 암흑기로 들어간다.
* 다계층 퍼셉트론 (MLP)를 사용하면 풀수 있다.
* 지구상에 누구도 MLP 노드를 학습시킬 좋은 방법을 찾지 못했다.

폴의 오차역전파법 논문에서 MLP의 노드 학습 방법을 찾는다.
크게 관심을 끌지 못한다.

힌튼 교수에 의해서 재발견 되고 관심이 촉발 되지만,
많은 수의 은닉 층에서 학습 능력이 떨어지는 단점과 함께 제 2의 암흑기를 겪는다.

지속적인 연구 끝에 적절한 초기 값(가중치)을 부여하는 것을 통해서 문제를 해소한다.
관심 촉발을 위해서 “딥러닝”이라는 단어를 사용한다.

다양한 과제 영역에서 성과들이 나오면서 전성기를 맞이한다.


**
신경세포 - Neuron
신경계를 구성하는 주된 세포이다.

자극전달 - impulse
일정 이상의 자극 ( 역치 : Threshold )이 주어 지면 전기 신호를 발생한다.

연접 - synapse
한 뉴런에서 다른 세포로 신호를 전달하는 연결 지점이다.

인공신경망 - artificial neural network
생물학적 신경망에서 영감을 얻은 통계학적 알고리즘이다.

딥 러닝 - deep learning
여러 비선형 변환기법의 조합을 통해 높은 수준의 추상화를 시도하는 기계학습(machine learning) 알고리즘의 집합으로 정의 되며, 큰틀에서 사람의 사고방식을 컴퓨터에게 가르치는 기계학습의 한 분야라고 이야기 할 수 있다.

기계학습 - Machine Learning
어떠한 태스크(T)에 대해 꾸준한 경험(E)을 통하여 그 T에 대한 성능(P)를 높이는 것, 이것이 기계학습이라고 할 수 있다. - by Tom M. Mitchell

오차역전파법 - back-propagation
네트워크에 기대되는 모든 가중치를 통해 손실함수의 값이 최소화가 되는 최적화 가중치를 추출하는 방법론이다.

손실함수 - loss function
사건(기술적으로 표본 공간의 한 요소)을 그 사건과 관련된 경제적 손실을 표현하는 실수로 사상하는 함수이다.

합성곱 신경망 - Convolutional Neural Network : CNN
최소한의 전처리(preprocess)를 사용하도록 설계된 다계층 퍼셉트론(multilayer perceptrons)의 한 종류이다.
영상, 음성 분야 모두에서 좋은 성능을 보여준다

퍼셉트론 - perceptron
인공 신경망의 한 종류로서 각 노드의 가중치와 입력치를 곱한 것을 모두 합한 값이 활성함수에 의해 판단되는데, 그 값이 임계치(보통 0)보다 크면 뉴런이 활성화되고 결과값으로 1을 출력한다. 뉴런이 활성화되지 않으면 결과값으로 -1을 출력한다.


참고

인공신경망 백서

인공신경망 동영상

인공신경망 아이디어 ( A -> B, C -> D )


2016년 3월 18일 금요일

주요 알고리즘 정리

자주 사용하는 알고리즘에 대한 정의 및 개인적인 포인트를 메모한다.

심층 신경망(Deep Neural Network, DNN)
입력 계층(input layer)과 출력 계층(output layer) 사이에 복수개의 은닉 계층(hidden layer)들로 이뤄진 인공신경망(Artificial Neural Network, ANN)이다.[17][18] 심층 신경망은 일반적인 인공신경망과 마찬가지로 복잡한 비선형 관계(non-linear relationship)들을 모델링할 수 있다. 예를 들어, 사물 식별 모델을 위한 심층 신경망 구조에서는 각 객체가 이미지 기본 요소들의 계층적 구성으로 표현될 수 있다.[19] 이때, 추가 계층들은 점진적으로 모여진 하위 계층들의 특징들을 규합시킬 수 있다. 심층 신경망의 이러한 특징은, 비슷하게 수행된 인공신경망에 비해 더 적은 수의 유닛(unit, node)들 만으로도 복잡한 데이터를 모델링할 수 있게 해준다.

딥러닝 (Deep Learning)
사람의 사고방식을 컴퓨터에게 가르치는 기계학습의 한 분야이다.
과학습(OverFitting)은 항상 주의 해야할 문제이다.
하드웨어 (GPU)와 분산 처리 기술의 발전으로 다시 주목 받고 있다.
컴퓨터 비전과 같은 특정 분야에서는 압도적인 성과를 보인다.

잠재변수(Latent Variable)
직접적으로 관찰되거나 측정이 되지 않는 변수를 의미한다.
딥러닝(deep learning)의 핵심 요소이다.

이미지 처리
convolution nxm
필터 효과를 만들어낸다.
subsampling nxm
이미지 분석에서는 일반적으로 Max 값을 추출한다. (max-pooling)

인공신경망 (artificial neural network)
생물학의 신경망에서 영감을 얻은 통계학적 알고리즘이다.
시냅스의 결합으로 네트워크를 형성한 인공 뉴런(노드)이 학습을 통해 시냅스의 결합 세기를 변화시켜, 문제 해결 능력을 가지는 모델 전반을 가르킨다.

서포트 벡터 머신(support vector machine, SVM)
기계 학습의 분야 중 하나로 패턴 인식, 자료 분석을 위한 지도 학습 모델이며, 주로 분류와 회귀 분석을 위해 사용한다. 두 카테고리 중 어느 하나에 속한 데이터의 집합이 주어졌을 때, SVM 알고리즘은 주어진 데이터 집합을 바탕으로 하여 새로운 데이터가 어느 카테고리에 속할지 판단하는 비확률적 이진 선형 분류 모델을 만든다. 만들어진 분류 모델은 데이터가 사상된 공간에서 경계로 표현되는데 SVM 알고리즘은 그 중 가장 큰 폭을 가진 경계를 찾는 알고리즘이다. SVM은 선형 분류와 더불어 비선형 분류에서도 사용될 수 있다. 비선형 분류를 하기 위해서 주어진 데이터를 고차원 특징 공간으로 사상하는 작업이 필요한데, 이를 효율적으로 하기 위해 커널 트릭을 사용하기도 한다.
**
최대 마진 경계를 찾는다.
비선형의 경우 새로운 차원 공간으로의 사상작업이 필요하다.

나이브 베이지안 (Naive Bayes, NB)
기계 학습 (Machine Learning) 분야에서, 나이브 베이즈 분류 (Naïve Bayes Classification)는 특성들 사이의 독립을 가정하는 베이즈 정리를 적용한 확률 분류기의 일종으로 1950 년대 이후 광범위하게 연구되고 있다.
**
올바른 클래스가 다른 클래스 보다 확률이 높을 경우 선택된다.
조건부 확률의 독립성을 가정한 알고리즘이다.
실제 확률로 볼 수는 없지만 분류에 있어 매우 효율적이다.
자연어 처리를 비롯한 많은 영역에서 사용되고 있다.

회귀분석(回歸分析, 영어: regression analysis)
관찰된 연속형 변수들에 대해 독립변수와 종속변수 사이의 상관관계를 나타내는 선형 관계식을 구하는 기법 및 이렇게 얻은 모형의 적합도를 측정하는 분석 방법이다
회귀분석은 시간에 따라 변화하는 데이터나 어떤 영향, 가설적 실험, 인과 관계의 모델링등의 통계적 예측에 이용될 수 있다.
**
표본에서 모집단 모수를 추정하기 위한 대표적인 방법이다.
최소제곱법(최소자승법)는 근사적으로 구하려는 해와 실제 해의 오차의 제곱의 합이 최소가 되는 해를 구하는 방법이다.
최대우도법(최대가능도방법)은 어떤 모수가 주어졌을 때, 원하는 값들이 나올 가능도를 최대로 만드는 모수를 선택하는 방법이다

오차와 잔차
모수에서는 실제 값과 추정 값과의 차이를 오차라 하고,
표본에서는 통계량의 개념을 갖는 잔차라는 단어를 사용한다.

결정 트리 학습법(decision tree learning)
어떤 항목에 대한 관측값과 목표값을 연결시켜주는 예측 모델로써 결정 트리를 사용한다
신경말 알고리즘이 여러 변수를 동시에 고려하지만 결정트리는 한개의 변수를 선택한다.
**
엔트로피 계수를 통해 분기의 우선 순위를 결정한다.
지니 불순도가 0이 될때 까지 분기한다.

엔트로피(독일어: Entropie)
열역학적 계의 유용하지 않은 (일로 변환할 수 없는) 에너지의 흐름을 설명할 때 이용되는 상태 함수다. 통계역학적으로, 주어진 거시적 상태에 대응하는 미시적 상태의 수의 로그로 생각할 수 있다. 엔트로피는 일반적으로 보존되지 않고, 열역학 제2법칙에 따라 시간에 따라 증가한다.

로렌츠 곡선
경제학에서 로렌츠 곡선은 하위 x%의 가구가 y%의 소득이 분배될 때의 확률 분포를 누적 분포 함수의 그래프로 나타낸 것이다. 로렌츠 곡선은 소득 분배 정도를 나타낼 때 주로 이용된다

지니 계수(Gini coefficient, 이탈리아어: coefficiente di Gini)
소득 격차를 계수화 한 것이다. 서로 다른 로렌츠 곡선들이 교차하는 경우 비교하기가 곤란하다는 로렌츠 곡선의 단점을 보완할 수 있다. 지니 계수는 소득 분배의 불평등함 외에도, 부의 편중이나 에너지 소비에 있어서의 불평등함에도 응용된다.
인구의 누적비율과 소득의 누적 점유율 사이의 상관관계를 나타내는 로렌츠 곡선은 소득분배가 완전히 평등하다면 기울기가 1인 대각선의 형태가 될 것이다.

로지스틱 회귀(영어: logistic regression)
D.R.Cox가 1958년에 제안한 확률 모델로서 독립 변수의 선형 결합을 이용하여 사건의 발생 가능성을 예측하는데 사용되는 통계 기법이다.
흔히 로지스틱 회귀는 종속변수가 이항형 문제(즉, 유효한 범주의 개수가 두개인 경우)를 지칭할 때 사용된다.
**
플롯으로 의미 들여다 보기
X = np.arange(-20,20)
e = 2.71828182846 # 근사치
logistic = lambda x: e ** x / ( 1 + e ** x)

with xkcd():
    title('logistic function')
    plot(X,[ logistic(x) for x in X ])
    ylim([-0.1,1.1])
    #grid()
    hlines(xmin=-20,xmax=20,y=0.5,linestyle='dashed')
    vlines(ymin=0,ymax=1,x=-10,lw=167,alpha=.3,color='blue')
    vlines(ymin=0,ymax=1,x=10,lw=167,alpha=.3,color='red')
    text(s='judged 0',x=-15,y=.2,fontsize=14)
    text(s='judged 1',x=10,y=1-.2,fontsize=14)

2016년 1월 19일 화요일

기초 통계 용어 정리

본문은 통계 관련 용어를 메모합니다.

가설 검정
모집단으로부터 추출한 표본을 사용하여 검토하는 통계적인 추론이다.
통계적인 유의성을 검정하는 것으로 유의성 검증 이라고도 한다.

가설의 두 가지
귀무가설 H0
비교하는 값과 차이가 없다는 것을 기본 개념으로 하는 가설이다.
대립가설 H1 (연구가설)
주장하는 가설로 차이가 있다는 것을 기본 개념으로 하는 가설이다.
직접 수행하기 불가능하여 귀무가설의 기각을 통해 받아들여 지는 반증을 거친다.

오류
제1종 오류(a error)
귀무가설 H0가 옳은데도 불구하고 H0를 기각하게 되는 오류이다.
제2동 오류(b error)
귀무가설 H0가 옳지 않은데도 불구하고 H0를 채택하는 오류이다.

기각역(critical region)
귀무가설 전제하에 구한 검정통계량의 분포에서 확율이 유의수준인 부분이다.

임계치(critical value)
주어진 유의수준에 따라 귀무가설의 기각 여부를 결정하는 기준점이다.

검정통계량
가설 검정을 위해서 사용하는 통계량을 말한다. 표본ㅌ

유의성
모집단에 대한 가설이 가지는 통계적인 의미이다.

유의수준 (Significance Level)
귀무가설이 사실임에도 기각하는 오류를 범할 확률이다.
유의수준 = 1 - 신뢰도

유의확률 (p-value)
영가설이 맞다고 가정할 때 얻은 결과 보다 극단적인 결과가 실제로 관측될 확률이다.
보통 0.05%의 유의 확률을 사용한다.

편차 (deviation)
평균과 관측값의 차이

분산 (variance)
편차의 제곱의 평균

표준편차 (standard deviation)
분산의 양의 제곱근

표준정규분포 (standard normal distribution)
평균은 0이고 표준편차가 1인 정규분포

정규분포 (normal distribution or 가우시안 분포: Gaussian distribution)
통계학에서 연속 확률 분포 중의 하나다.

T-Test
단일표본 T검정
독립표본 T검정
대응표본 T검정

Z-Test
모집단의 분산을 알고 있는 경우 사용

산포도(degree of scattering)
자료의 흩어진 정도 분산, 범위, 사분위수범위 등이 해당한다.

범위(range)
자료의 가장 큰값과 가장 작은값 간의 차이, 외부 특이점(Outlier)에 대한 처리가 필요하다.

사분위수(quartiles)
측정값을 정렬해서 4등분으로 나눈 것을 말한다.

모집단(population)
정보를 얻고자 하는 관심 대상의 전체 집합이다.

모수 (Parameter)
모집단의 특성을 기술하는 특정한 값을 말한다.

신뢰 구간 (confidence interval)
모수가 어느 범위 안에 있는지를 확률적으로 보여주는 방법이다.

정규성 검정
표본수 > 30 : 중심극한정리에 의해 정규성을 가지는 것으로 가정할 수 있음
30 > 표본수 > 10 : 정규성 검정 필요
10 > 표본수 : 정규성을 인정 받을 수 없음으로 비모수적인 통계 방법 사용

정규성 검정 방법
Kolmogorov-Smirnov test : 샘플의 수가 2000개 이상일때,
Sapiro-Wilks test : 샘플의 수가 4 - 2000개 이하일때,

모수적 방법 (Parametric)
표본 평균 검증
T 검정, Z 검정
표본 분산 검정
F 검증, 카이제곱 검정

비모수적 방법(Non-parametric)
정규분포가 아니거나 표본의 수가 적을때 사용
부호 검정 (Sign test)
관측치들 간에 크다 작다 혹은 같다라는 주장이 사실인지 검정
윌콕슨 부호 순위 검정
부호뿐만 아니라 관측치 간의 차이의 크기, 순위까지 고려하여 검정
크루스칼-왈리스 검정
3개 이상 집단의 중앙값 차이를 검정

외도 (Skewness)
크다 : 오른쪽 롱꼬리

첨도 (kurtosis)
크다 : 위로 솟다.

검정 통계량 (or 표본 통계량)
모집단 전체 조사가 힘든 경우 검정하기 위한 표본을 통계한다.

확률 분포
정규 분포, T 분포, 카이제곱 분포, F 분포
확률 분포 그래프의 X 좌표를 구한다.

확률 분포 (probability distribution)
확률 변수가 특정한 값을 가질 확률을 나태내는 함수를 의미한다.

이산 확률분포 (distribute of discrete random variable)
이산 확률 변수가 가지는 확률분포를 의미한다.

** 이산 확률 변수 (discrete random variable)

연속 확률분포 (continuous probability distribution)
확률 밀도 함수를 이용해 분포를 표현할 수 있는 경우를 의미한다.

** 연속 확률 변수 (continuous random variable)

확률 밀도 함수 (probability density function, PDF)
확률 변수의 분포를 나타내는 함수이다.

확률 질량 함수 (probability mass function, PMF)
이산 확률 변수에 의한 확률 분포 함수를 의미한다.

누적 분포 함수 (cumulative distribution function, CDF)
확률 변수가 특정 값보다 작거나 같은 확률을 나타낸다.

이항 분포 (binormial distribution)
연속된 n번의 독립적 시행에서 각 시행이 확률 p를 가질 때의 이산 확률 분포이다.

확률 변수 (random variable)
어떤 시행의 결과로 나타나는 각각의 실수값이다.

다항식 (polynomial)
1개 이상의 항으로 이루어진 식을 말한다.

다항식의 차수 (degree of polymormial)
각 항의 각 문자의 자수를 합친 것 중 가장 큰 값을 해당 다항식의 차수라 한다.
예) x^2 * y^3 은 5차수

X차 방정식
최고차 항의 차수가 X인 다항 방정식을 뜻한다.

방정식 (equation)
특정한 문자의 값에 따라 참/거짓이 결정되는 등식이다.
이때, 방정식을 참이 되게 하는 특정 문자의 값을 해(근)이라 한다.

실수
유리수 / 정수 (음, 양, 0) , 정수가 아닌 유리수 (유한 소수, 순한 소수)
무리수 / 순한하지 않는 소수

이산 수학 (Discrete mathematics)
이산적인 수학 구조에 대해 연구하는 학문으로, 연속되지 않은 공간을 다룬다.


커버사진
참조 : https://www.coursera.org/course/introstats