농심NS Sensory
실험 시작하기 →
NONGSHIM SENSORY R&D

맛의 의사결정을
통계 모형 위에 올립니다

실험 설계(DoE)부터 쌍대비교 관능평가, Bradley-Terry·회귀 분석, 예측·시뮬레이션까지. 레시피·원료·공정, 맛으로 결정해야 하는 모든 실험이 하나의 파이프라인에서 끝납니다. 평가가 저장되는 순간 분석이 갱신되고, 다음에 맛볼 쌍은 플랫폼이 추천합니다.

점수가 아니라 비교를 묻는 이유

절대 점수는 잡음이 크다

9점 척도는 평가자마다 기준점이 달라 분산이 큽니다. 인간의 판단은 절대 강도보다 비교 판단에서 훨씬 정확하고 일관적이라는 것이 정신물리학의 오래된 결론입니다 (Thurstone의 비교판단 법칙, 1927). NS Sensory는 “몇 점인가” 대신 “둘 중 무엇이 더 센가”만 묻습니다.

도구 단절이 데이터를 깎는다

설계는 통계 소프트웨어, 수집은 종이와 엑셀, 분석은 다시 소프트웨어로. 단계가 끊길 때마다 전사 오류와 시간이 쌓입니다. 여기서는 설계 행렬이 곧 시료 제조표가 되고, 품평 입력이 곧 분석 데이터가 됩니다.

시료 평균은 검정력을 버린다

시료당 점수 하나로 요약하면 자유도가 시료 수에 갇힙니다. 비교 한 건을 관측 한 건으로 쓰는 Bradley-Terry 모형은 같은 데이터에서 수십 배의 자유도를 끌어내 더 작은 효과를 더 확실하게 검정합니다.

설계에서 예측까지, 한 흐름

1 · 설계

목표(스크리닝/교호작용)를 고르면 최소·권장 런 수와 필요한 평가량을 계산해 D-최적 설계를 생성합니다. 랭크·VIF·교락 진단이 즉시 따라오고, 부족하면 기존 런을 유지한 채 증강합니다.

2 · 관능평가

Fisher 정보 이득이 가장 큰 쌍을 능동 추천하고 좌우를 무작위 배치합니다. 5단계 판정이 실시간 저장되고, 순위 안정성 곡선이 언제 평가를 멈춰도 되는지 알려줍니다.

3 · 분석

Elo 순위, Bradley-Terry 영향도, ANOVA·잔차 진단·효과 파레토, 적합결여 검정, 반응표면과 desirability 다중 반응 최적화까지. 평가가 쌓일 때마다 전부 다시 계산됩니다.

4 · 예측

처방 시뮬레이터로 새 배합의 감각을 신뢰구간과 함께 미리 보고, 기존 시료와의 가상 맞대결 승률을 계산합니다. 부트스트랩으로 '1위일 확률'까지 보고합니다.

기존 평가도구와의 차이점

Design-Expert는 검증된 범용 DoE 분석 도구지만, 런마다 반응값이 이미 있다고 가정합니다. 관능 실험의 실제 병목은 그 반응값을 만드는 일이고, NS Sensory는 그 지점부터 설계됐습니다.

기능Design-ExpertNS Sensory
반응값(관능 데이터) 수집없음 · 외부에서 값을 만들어 입력쌍대비교 평가 내장 · 웹/모바일 · 다중 평가자
쌍대비교 데이터 직접 분석불가 · 런당 1개 값 필요Bradley-Terry · 비교 1건 = 관측 1건 · 과산포 보정
다음 시식 쌍 추천 (능동 학습)없음 · 수집 단계 자체가 없음Fisher 정보 이득 최대 쌍 자동 제시
적합결여(교호작용 존재) 검정반복런이 있어야 가능비교 단위 검정 · 반복런 불필요
분석 갱신파일 불러오기 후 수동 재분석평가 저장 즉시 실시간 갱신
협업 · 동시 평가단일 PC 좌석 라이선스URL 공유 · 동시 평가 · 평가자 기록
설계 생성 · 증강대화형 설정 필요목표 선택만으로 권장 런 계산 · D-최적 생성 · 평가 유지 증강
ANOVA · 잔차 진단제공ANOVA · Q-Q·잔차 플롯 · 파레토 · Pred R² · 웹에서 실시간
다중 반응 최적화desirability 수치 최적화Derringer-Suich desirability + 등고선·3D · 실시간 데이터 연동
예측 · 불확실성점 예측 + 신뢰구간점 예측 · 가상 맞대결 승률 · 부트스트랩 순위 확신도 · 안정성 곡선
검증 재현성벤더 문서 기반 · 사용자가 재현 불가앱 안에서 셀프 검증 스위트 즉시 재실행
감사 추적 (원자료)런 요약값만 입력·보관모든 판정·평가자·시각 보존 · 전수 내보내기
라이선스 비용좌석당 연간 유료사내 무제한 · 웹 배포

검증 재현성 항목은 말이 아니라 실행으로 확인할 수 있습니다: 셀프 검증 스위트 직접 실행해 보기 → 규제 제출용 상용 문서가 꼭 필요한 경우에도 원자료 CSV로 Design-Expert에 그대로 연결됩니다.

알고리즘 소개

모든 수치는 아래 모형에서 나옵니다. 구현은 외부 통계 라이브러리 없이 플랫폼 안에 있으며, 정답을 심은 시뮬레이션(계수 부호·크기 복원, 거짓 유의 점검)으로 검증했습니다.

01

쌍대비교와 부분승 점수

Thurstone (1927) Law of Comparative Judgment · David (1988) The Method of Paired Comparisons

평가자는 두 시료 중 어느 쪽이 더 센지(좋은지)를 5단계로 판정합니다. 판정은 왼쪽 시료 기준의 부분승 점수로 변환됩니다.

S{1, 0.75, 0.5, 0.25, 0}S \in \{1,\ 0.75,\ 0.5,\ 0.25,\ 0\}

절대 점수 대신 비교를 쓰는 근거는 정신물리학입니다. 사람의 감각 판단은 기준점 이동(drift)과 개인차가 커서 절대 척도의 재현성이 낮은 반면, 동시 비교는 같은 맥락에서 이뤄져 판별력이 높습니다. 쌍 제시는 덜 비교된 조합을 우선하고 좌우를 무작위화해 위치 편향을 상쇄합니다.

02

Bradley-Terry 모형과 성분 효과

Bradley & Terry (1952) Biometrika · Wedderburn (1974) quasi-likelihood

시료 i가 j를 이길 확률을 잠재 강도 θ의 차이로 모형화합니다.

P(ij)=11+e(θiθj)P(i \succ j) = \frac{1}{1 + e^{-(\theta_i - \theta_j)}}

성분 효과를 추정할 때는 강도를 코딩된 배합비의 선형결합으로 둡니다. 비교 한 건이 관측 한 건이므로 자유도는 비교 수를 따릅니다.

θi=kβkxik,P(ij)=σ ⁣(kβk(xikxjk))\theta_i = \textstyle\sum_k \beta_k x_{ik}, \qquad P(i \succ j) = \sigma\!\big(\textstyle\sum_k \beta_k (x_{ik} - x_{jk})\big)

관능 판정은 이항분포보다 산포가 크므로(평가자 간 이질성) Pearson 통계량으로 과산포를 추정해 표준오차를 보정합니다. 이것이 없으면 p값이 낙관적으로 나옵니다.

φ^=XPearson2Np,SEadj=φ^SE\hat\varphi = \frac{X^2_{\text{Pearson}}}{N - p}, \qquad \mathrm{SE}_{\text{adj}} = \sqrt{\hat\varphi}\,\cdot\,\mathrm{SE}

저수준 대 고수준 맞대결 승률로 환산해 보고합니다:  100/(1+e2βk)%\;100/(1+e^{-2\beta_k})\,\%. 50%면 효과 없음, 70%면 열 번 중 일곱 번 더 세게 느껴진다는 뜻입니다.

03

Elo 레이팅 (실시간 지표)

Elo (1978) The Rating of Chessplayers

평가 진행 중 실시간 순위는 체스 레이팅과 같은 온라인 업데이트로 계산합니다.

EA=11+10(RBRA)/400,RA=RA+K(SEA),K=32E_A = \frac{1}{1 + 10^{(R_B - R_A)/400}}, \qquad R_A' = R_A + K\,(S - E_A),\quad K=32

한 건마다 즉시 갱신되어 품평 현장에서 순위를 바로 보여주는 데 적합합니다. 다만 Elo는 비교 순서에 의존하므로, 최종 추론(효과 추정·검정)은 순서 불변인 Bradley-Terry 최우추정을 사용합니다. 두 지표가 크게 다르면 데이터에 비순환성 위반(가위바위보 구조)이 있다는 신호이기도 합니다.

04

D-최적 실험 설계와 증강

Fedorov (1972) Theory of Optimal Experiments · Atkinson, Donev & Tobias (2007)

배합비는 저/고 수준을 ±1로 코딩합니다.

xcoded=u(umin+umax)/2(umaxumin)/2x_{\text{coded}} = \frac{u - (u_{\min}+u_{\max})/2}{(u_{\max}-u_{\min})/2}

모형행렬 X에 대해 계수 추정 오차는Var(β^)=σ2(XX)1\operatorname{Var}(\hat\beta) = \sigma^2 (X^\top X)^{-1}이므로, 후보점(2ᵏ 꼭짓점) 중 정보행렬의 행렬식을 최대화하는 런을 고릅니다.

X=argmaxX  det ⁣(XX)X^* = \arg\max_X \; \det\!\big(X^\top X\big)

구현은 greedy exchange입니다: 현재 설계의 분산함수d(x)=x(XX)1xd(x) = x^\top (X^\top X)^{-1} x가 최대인 후보를 하나씩 추가합니다. 같은 알고리즘이 기존 런을 고정한 채 추가 런만 뽑는 설계 증강에도 쓰여, 평가 데이터를 버리지 않고 설계를 키웁니다. 교락 진단은 분산팽창계수로 봅니다:

VIFj=11Rj2(요인 j를 나머지 요인으로 회귀한 R2)\mathrm{VIF}_j = \frac{1}{1 - R_j^2} \quad (\text{요인 } j \text{를 나머지 요인으로 회귀한 } R^2)
05

주효과 회귀와 적합결여 검정

Box, Hunter & Hunter (2005) Statistics for Experimenters

응답 지표(Elo 또는 승률)를 코딩된 요인으로 회귀합니다.

y^=β0+jβjxj,효과j=yˉ(+1)yˉ(1)=2βj\hat y = \beta_0 + \textstyle\sum_j \beta_j x_j, \qquad \text{효과}_j = \bar y_{(+1)} - \bar y_{(-1)} = 2\beta_j

“주효과만으로 충분한가?”는 적합결여 검정으로 답합니다. 시료 강도를 자유롭게 둔 포화 모형과 주효과 모형의 이탈도 차이를 과산포로 나눈 F 통계량입니다.

F=(DmainDfree)/(dffreedfmain)φ^    FΔdf,  NdffreeF = \frac{(D_{\text{main}} - D_{\text{free}})/(df_{\text{free}} - df_{\text{main}})}{\hat\varphi} \;\sim\; F_{\Delta df,\; N - df_{\text{free}}}

p<0.05면 주효과로 설명되지 않는 구조(교호작용·곡률)가 있다는 신호이고, 플랫폼은 설계 증강을 권합니다. 중심점 반복이 있으면 곡률도 따로 점검합니다:  yˉcenteryˉfactorial\;\bar y_{\text{center}} - \bar y_{\text{factorial}}이 잔차 산포보다 크면 2차항이 필요한 영역입니다.

06

능동 학습 쌍 추천

Fedorov (1972) · Chaloner & Verdinelli (1995) Bayesian Experimental Design

다음 비교 한 건이 계수 불확실성을 얼마나 줄이는지는 닫힌 형태로 계산됩니다. 랭크-1 행렬식 보조정리에 의해:

logdet ⁣(I+wdd)logdetI=log ⁣(1+wdI1d),w=p^(1p^)\log\det\!\big(I + w\,dd^\top\big) - \log\det I = \log\!\big(1 + w\, d^\top I^{-1} d\big), \qquad w = \hat p\,(1-\hat p)

d는 두 시료의 배합 차이, I는 현재 Fisher 정보행렬입니다. 이 값을 모든 쌍에 대해 실시간으로 계산해 최대 쌍을 제시합니다. w가 p̂=0.5에서 최대이므로 이 기준은 자동으로 결과가 확실한 쌍을 건너뛰고 우열이 갈리지 않은 접전 쌍에 시식을 집중시킵니다. 같은 시식 횟수로 더 좁은 신뢰구간을 얻습니다.

07

순위 확신도와 안정성

Efron (1979) Bootstrap · Kendall (1938) rank correlation

순위는 점추정입니다. 비교 데이터를 복원추출로 400회 재구성해 매번 순위를 다시 매기면 “1위” 대신 “1위일 확률 82%, 순위 95% 구간 1~3위”로 보고할 수 있습니다. 평가를 언제 멈출지는 리플레이 곡선으로 판단합니다:

τ=CD(n2)    [1,1]\tau = \frac{C - D}{\binom{n}{2}} \;\in\; [-1, 1]

비교를 시간 순으로 재생하며 각 시점의 순위와 현재 순위의 켄달 τ(일치·불일치 쌍 비율)를 그립니다. 곡선이 1에 붙어 평평해지면 추가 평가가 순위를 더 바꾸지 않는다는 신호입니다.

첫 실험을 설계해 보세요

요인 입력부터 분석 리포트까지, 10런 데모로 전체 흐름을 5분 안에 볼 수 있습니다.