μ€ν ν¬λ Statistical Learning λλ²μ§Έ μ±ν° λ΄μ©μ΄λ€.
μ΄μ€ 2.1~2.3 λ΄μ©μ λ€λ£¨κ² λ€. κ°μ λ΄μ©μ μ μ ν μ¬κ΅¬μ± λ° μμ½νλ€.Β
Ch2 ν΅κ³μ νμ΅ κ°μ2.4 λΆλ₯λΆμ
2.1 νκ·λΆμ μ
λ¬Έ
2.2 μ°¨μ λ° κ΅¬μ‘°μ λͺ¨λΈ(structured models)
2.3 λͺ¨λΈ μ μ λ° νΈν₯-λΆμ° νΈλ μ΄λμ€ν
2.R
R μκ° μ‘΄ μ±λ²μμ μΈν°λ·°
(μΆμ²: Statistical Learning, Stanford Online Lagunita) Β
νμ€μμ½
νκ·λΆμμ λν μ μ, μ°¨μμ μ μ£Ό, κ·Έλ¦¬κ³ νκ·λΆμ μΈμ μ°μ΄λ λ€μν λΆμ κΈ°λ² μ’
λ₯μ μμΈ‘μ νλμ ν΄μκ°λ₯μ±μ κ΄κ³, κ·Έλ¦¬κ³ MSE(νκ· μ κ³±μ€μ°¨), λΆμ°, νΈν₯μ λν΄ μ€λͺ
νλ€.
1. νκ·(regression)μ΄λ 무μμΌκΉ?
μλ₯Ό λ€μ΄, λ§€μΆμ΄ TV, λΌλμ€, μ λ¬Έ κ΄κ³ μ μν₯μ λ―ΈμΉλ€κ³ μκ°ν΄λ³΄μ. Β TV, λΌλμ€, μ λ¬Έ κ°κ° λλ μ λ§€μΆμ μν₯μ λ―ΈμΉλ κ²μ μκ°ν΄ λ³Ό μλ μκ³ , TV, λΌλμ€, μ λ¬Έ ν©μ³μ λ§€μΆμ μν₯μ λ―ΈμΉλ κ²μΌλ‘ μκ°ν΄ λ³Ό μ μλ€.
μνμΌλ‘ νννλ©΄, Β Β λ§€μΆ β f(TV, λΌλμ€, μ λ¬Έ) μΌλ‘ ννμ΄ κ°λ₯νλ€. μ¬κΈ°μ 'λ§€μΆ'μ΄ λ°μκ° λλ νκΉκ°μΌλ‘ μ°λ¦¬κ° μμΈ‘νκ³ μ νλ κ°μ΄λ€. λ³΄ν΅ μ΄λ₯Ό Yλ‘ νννλ€. TV, λΌλμ€, μ λ¬Έ λ±μ νΌμ²(feature), μΈν, μμΈ‘μΈμλΌκ³ νλ©°, κ°κ° X1, X2, X3μΌλ‘ νννλ€. X = ( X1, X2, X3 ) Β * μ ννλ 1, 2, 3μ μλ첨μκ°μ΄λ€.
μ΄λ₯Ό μν 곡μ, νκ·λΆμμμΌλ‘ νννλ©΄,
Y = f(X) + Ξ΅ μ΄λ€. μ΄κ² λ°λ‘ νκ·λΆμ κΈ°λ³Έ ννμ΄λ€.
νκ·λΆμμ μ΄λ€ λ
립λ³μκ° λ°μκ°, λͺ©νκ°μ μ΄λ€ μν₯μ λ―ΈμΉλμ§ νμ
νκ³ μ νλ λΆμμ΄λ€. μ΄λ₯Ό ν΅ν΄ λ
립λ³μ κ°μ λ°λ₯Έ μμΈ‘λ κ°λ₯νλ€.
μμ κ°μ κ²½μ°μλ, TV, λΌλμ€, μ λ¬Έ κ΄κ³ κ° λ§€μΆμ μΌλ§λ μν₯μ λ―ΈμΉκ±°λ κ΄λ ¨μ± μ¬λΆ λ±μ νμ
νλ κ²μ΄λ€. λλ€λ₯Έ μλ‘, μ°κ³΅μμ΄(Seniority), κ΅μ‘μμ€ λ±μ΄ μμ
μν₯μ λ―ΈμΉλ λ°λ©΄, κ²°νΌ μ¬λΆλ μμ
μ μν₯μ λ―ΈμΉμ§ μλλ€λ κ² λ±μ νμ
ν μ μλ€.
2. νκ·λΆμμ λν΄ μ’ λ μ νν μ΄ν΄λ³΄μ.
μ¬λ¬ λ°μ΄ν°κ°μ΄ μλλ° X = 4μ λν΄ λ€μν Yκ°μ΄ μμ κ²μ΄λ€. Β (4, 5), (4, 10), (4, 0), .... , μ΄λ Yλ Xκ° 4μΌ λ μμν μ μλ κ°μΌλ‘ νκ· μΌλ‘ νννλ€. μ¦, Xκ° 4μΌλμ Yκ°λ€μ νκ· μ Yκ°μΌλ‘ λ³Έλ€. μ΄λ₯Ό μμΌλ‘ νννλ©΄, f(4) = E(Y | X = 4) μ΄λ€.
f(x) = E(Y | X = x) μ΄ ννκ° νκ·λΆμμΌλ‘ λνλ΄μ§λ€(Yμ νκ· κ°μΌλ‘ νννλ€λ μλ―Έ, νκ· μΌλ‘ λμκ°λ€λ μλ―Έλ‘ νκ·λΆμμ΄λ€!) μ TV, λΌλμ€, μ λ¬Έ κ΄κ³ λ₯Ό νκ·λΆμ ννλ‘ νννλ©΄
,f(x) = f(x1, x2, x3) = E(Y | X1 = x1 | X2 = x2 | X3 = x3) μ΄λ€.
νκ·λΆμμ΄ μ νν΄μ§λ €λ©΄, μ€μ°¨κ°μ΄ μμμΌ νλ€. μ¦, μμΈ‘κ°κ³Ό μ€μ κ°κ³Όμ μ°¨μ΄μΈ μ€μ°¨κ°μ΄ μμ κ²½μ°, νκ·λΆμ μμ΄ μ ννλ€κ³ λ³Ό μ μλ€. μ€μ°¨λ₯Ό μ‘μ€λ‘ Ξ΅ μΌλ‘ νννκ³ κ°μ΄ κ°μ₯ μμ κ°μ΄μ΄μΌ νλλ°, Ξ΅ = Y - f(x) λ λλ€λ₯Έ λ§λ‘ νμ°μ μΌλ‘ λ°μνλ μ€μ°¨, μ€μΌ μ μλ μ€μ°¨(irreducible error)λΌκ³ νλ€. μ΄λ₯Ό μ’λ νμΌλ©΄, μλμ κ°λ€.
E[(Y β f^(X)) | X = x] = [f(x) β f^(x)]^2 + Var(Ξ΅) μ¬κΈ°μ, [f(x) β f^(x)]^2λ μ€μΌ μ μλ μ€μ°¨(reducible error)μ΄λ©°, Var(Ξ΅)λ νμ°μ μΌλ‘ λ°μνλ μ€μ°¨(irreducible error)λΌ νλ€.
3. νκ·λΆμμμ κ·ΈλΌ νΉμ κ°μ λν Yκ°μ΄ μ‘΄μ¬νμ§ μλλ€λ©΄? λλ κ·Έ κ°μ΄ λ§€μ° μ λ€λ©΄??
μ¬κΈ°μ μΈ μ μλ λ°©λ²μ xκ°μ μ΄μν κ°λ€μ ν΅ν΄ Yμ λν νκ· κ°μ ꡬνλ κ²μ΄λ€. ν¨κ»νλ κ°λ€ f^(x) = Ave(Y | X β N(x)) μ¬κΈ°μ N(x)λ xκ°μ μ΄μν κ°λ€λ‘ 보면 λλ€.
μ΄ μ΅κ·Όμ μ΄μ(Nearest neighbor methods) μ κ·Όλ²μ μ°¨μμ΄ μ κ±°λ(4 μ΄ν), κ·Όμ² μ΄μμ λ§μ΄ ν¬ν¨νλ©΄ μμΈ‘κ°μ΄ μ’λ€. νμ§λ§, Pκ° λλ μ°¨μμκ° λ§μμ§λ©΄, μ°¨μμ μ μ£Ό(curse of dimensionality)μ λ°λΌ μμΈ‘κ° κ΅¬νλκ² μ΄λ ΅λ€. μ°¨μμ΄ μ»€μ§μλ‘, Yκ° λΆμ°μ 10% μ΄νλ‘ νκΈ° μν xκ°μ μ°ΎμΌλ €λ©΄, P μ°¨μμλ₯Ό λ²μ΄λ λ°μ΄ν°λ ν¬ν¨ν΄μΌ νκΈ°μ, (λ‘컬 λΆμ)νκ·λΆμμ μ μ©νκΈ° μ΄λ €μμ§λ€. Β μ°Έκ³ λ‘, 컀λ(kernel)μ΄λ μ€νμΈ μ€λ¬΄λ©(spine smoothing)μ΄ λ³΄λ€ λ°μ΄ν° λΆν¬λ₯Ό μ νννλ€.
4. νκ·λΆμμ μ νμμΌλ‘ ννν΄λ³΄μ.
νκ·λΆμμ μ ν λ° νλΌλ―Έν° ννλ‘ νννλ©΄,
fL(X) = Ξ²0 + Ξ²1X1 + Ξ²2X2 + ,,, Ξ²pXp μ¬κΈ°μ Lμ μλ첨μ, Linearμ μ½μλ‘, Ξ²κ°μ p (μ°¨μ) μλ³΄λ€ 1νλκ° λ§λ€. Yμ νΈκ°μ΄ Ξ²0 λλ¬Έμ κ·Έλ λ€. Ξ²μ μ«μλ λͺ¨λ μλ첨μμ΄λ€.
5. κ³Όλμ ν©(Overfitting)
μ£Όμ΄μ§ λ°μ΄ν°(training data)μ μ ν©ν νκ·λΆμμμ λ§λ€μ΄, λ€λ₯Έ ν
μ€νΈ λ°μ΄ν°(test data)λ‘ ν
μ€νΈν΄λ³΄λ©΄, μμΈ‘κ°μ΄ λ§μ΄ λΉλκ° μ μλ€. νΈλ μ΄λ λ°μ΄ν°μλ§ λ§€μ° μ νν μμΈ‘κ°μ κ°λ κ²μ κ³Όλμ ν©(overfitting)μ΄λΌ νλ€.Β
6. ν΄μκ°λ₯μ±(interpretability) λ° μμΈ‘ μ νμ±(Prediction accuracy)
λΆμκΈ°λ²μλ μ¬λ¬κ°μ§κ° μλλ°, μ΄λ₯Ό ν΄μ κ°λ₯μ±κ³Ό μμΈ‘ μ νμ±κ°μλ νΈλ μ΄λμ€ν κ΄κ³μ μλ€. μλ₯Ό λ€μ΄, μ ννκ·λΆμμμ, λ°μ΄ν° λΆν¬ λ° μλ―Έμ λν΄ ν΄μ κ°λ₯μ±μ΄ λμ λ°λ©΄, μμνλ μ΄νΈ μ€νμΈ κΈ°λ²(μ±ν° 7μμ μ€λͺ
μμ )μ μμΈ‘ μ νμ±μ λμ λ°λ©΄μ μμ λν ν΄μμ΄ μ΄λ ΅λ€. κΈ°λ²λ€μ μ 2κΈ°μ€μ λ°λΌ λΆλ₯νλ©΄ μλμ κ°μ κΈ°μ€μΌλ‘ λ³Ό μ μλ€.
- μμΈ‘ μ νμ± : λ°°κΉ
, λΆμ€ν
, μν¬νΈ λ²‘ν° λ¨Έμ > μΌλ°νκ°λ²λͺ¨λΈ, νΈλ¦¬ > μ΅μ μ κ³± > μλΈμΈνΈ, λΌμ
- ν΄μ κ°λ₯μ± : μλΈμΈνΈ, λΌμ, > μ΅μ μ κ³± > μΌλ°νκ°λ²λͺ¨λΈ, νΈλ¦¬ > λ°°κΉ
, λΆμ€ν
, μν¬νΈ λ²‘ν° λ¨Έμ
7. λͺ¨λΈ μ νλ μΈ‘μ νκΈ°
μ€μ λ‘ λ°μ΄ν°μ λν νκ·λΆμμμ ꡬμ±νκ³ , μ΄μ λν μ νλλ₯Ό μΈ‘μ νλ €λ©΄ μ΄λ»κ² ν΄μΌ ν κΉ? κ°μ₯ κ°λ¨ν μκ°ν΄λ³΄λ©΄, μ€μ κ°κ³Ό νκ·λΆμμμμ λμ¨ κ°κ³Όμ μ°¨μ΄λ₯Ό 보면 λλ κ²μ΄λ€. μμΈ‘κ°μ΄ μμμΌ μλ μκΈ° λλ¬Έμ (μ€μ κ° β νκ·λΆμμκ°)^2 μ μ κ³±μ ν λ€, μ΄μ λν νκ· κ°μ ꡬνλ€. μ¦, MSE(Mean Square Error)κ° μμμλ‘ λΆμμ μ νλκ° λλ€κ³ ν μ μλ€.
μ΄λ₯Ό μμμΌλ‘ νννλ©΄,
MSE = Avei[yi β f^(xi)]^2
μ΄λ©°, μ¬κΈ°μ iλ²μ§Έ xμ μμΈ‘κ°κ³Ό, μ€μ iλ²μ§Έ λͺ©νκ°κ³Όμ μ°¨μ΄μ λν μ κ³±νκ· κ°μ λνλΈλ€.
8. νΈν₯(Bias)μ λΆμ°(Variance)μμ νΈλ μ΄λ μ€ν
Tr(νΈλ μ΄λ λ°μ΄ν°)λ₯Ό f^(x)μ νμ΅μν€κ³ , ν
μ€νΈ λ°μ΄ν°λ₯Ό (x0, y0)μ΄λΌ ν λ, μ΄μ λν νκ·λΆμμμ Y = f(X) + Ξ΅ μ΄λ€. μ΄μ λν, μ€μ°¨κ°μ μ’ λ μΈλΆννλ©΄, μλμ κ°μ΄ ꡬλΆμ΄ κ°λ₯νλ€.
E[y0 β f^(x0)]^2 = Var(f^(x0)) + [Bias(f^(x0))]2 + Var(Ξ΅) μ¦, x0μΌλμ λΆμ°κ°κ³Ό, x0μΌλμ νΈν₯κ°, κ·Έλ¦¬κ³ μ€μΌ μ μλ μ€μ°¨ λΆμ°κ°μ ν©μ΄λ€. μ¬κΈ°μ νΈν₯κ°μ Bias(f^(x0))] = E[f^(x0)] β f(x0) μΌλ‘ λ³Ό μ μλ€. μ¦, x0μ νκ· κΈ°λμΉ y0κ°μμ x0μ y0κ°μ λΊ κ°μ΄λ€. κ²°λ‘ μ μΌλ‘, λ³΄ν΅ μμΈ‘ μ νλ(flexibility)κ° μ¦κ°ν λ, λΆμ°μ΄ μ¦κ°νλ©°, νΈν₯μ κ°μνλ€.
κ°μμκ° μ§ννν©: 8%