본문으로 건너뛰기

분석 방법: 화학계량학, 심층 분광법, 그리고 자동 크로마토그램

📍 현재 위치: 2부 · 학습된 발견과 개발(Discovery & Development, Learned) — 8장. 지난 장은 베이즈 최적화(Bayesian optimization)를 써서 요인 격자(factorial grid)가 필요로 하는 운전 수의 한 토막으로 공정을 골랐습니다. 그러나 그 운전 하나하나는 그것이 무엇을 만들었는지를 측정할 수 있어야만 셈에 듭니다. 이 장은 학습 렌즈를 분석 실험실로 돌립니다 — BATCH-2026-001이 98.611 퍼센트 단량체(monomer, 온전하고 올바르게 조립된 항체)인지 규격 미달(OOS — out of specification, 수용 한계를 벗어난 출하 결과로, 공식 조사가 종결되기 전까지 출하를 막음)인지를 결정하고, BATCH-2026-004를 숙주세포 단백질(host-cell protein, 세포로부터 넘어온 공정 불순물)에서 100 ng/mg 한계에 대해 128 ng/mg로 규격 미달로 표시한 그 기기들 말입니다. (출하 시험과 이 수용 한계들은 1권의 QC 및 출하 장에 있습니다.)

분석 실험실은 공정이 숫자가 되는 곳입니다. 바이오리액터가 아름답게 돌아갈 수 있지만, 분석법(assay)이 역가, 순도, 글리칸 프로파일을 보고하기 전까지 그 운전은 소문일 뿐입니다. 그리고 분석 실험실은 바이오 제조에서 가장 오래 조용히 기계학습을 해 온 부분입니다 — 40년 동안, 과대광고를 앞선 이름으로: 화학계량학(chemometrics). 라만 프로브는 글루코스 농도를 내보내지 않습니다. 그것은 천 개의 강도 채널(스펙트럼을 따라 각 지점에서 측정된 하나의 빛 강도)을 내보내고, 모델이 그 채널들을 숫자로 바꿉니다. 누가 그렇게 부르든 말든, 그 모델은 기계학습입니다.

이 장은 학습 렌즈를 통해 실험실의 기기들을 훑으며, 이 분야가 흔히 흐리는 구분에 신중을 기합니다. 오늘날 상용에서 돌아가는 확립된 화학계량학(PLS, PCA — 선형이고, 해석 가능하며, 검증됨)과, 문헌이 흥분하는(스펙트럼 위의 CNN, 오토인코더, 트랜스포머) 그러나 GMP 실험실(우수 제조 관리 기준, Good Manufacturing Practice — 상용 의약품 배치가 그 아래에서 돌아가는 법적 강제력을 가진 품질 시스템으로, 모든 방법과 모델이 검증·재현·감사 가능해야 함)에 거의 도달하지 못한 심층학습 사이의 간극입니다. 우리는 그 대비를 실행 가능한 코드로 만듭니다 — 같은 라만 스펙트럼 위에서 PLS 베이스라인에 맞서는 1차원 합성곱망 — 그리고 그 결과는 이 장에서 가장 정직한 것입니다. 작고 깨끗한 스펙트럼에서는 심층 모델이 이기지 못합니다.

쉽게 말하면

와인 시음가는 잔마다 질량분석기를 돌리지 않습니다. 그들은 값싸고 빠른 신호 몇 개를 냄새 맡고 맛보며, 여러 해에 걸쳐 배운 패턴으로부터 품종, 산지, 빈티지를 추론합니다. 화학계량학은 화학을 위한 그 학습된 추론입니다. 스펙트럼("냄새")이 들어가고, 농도나 품질 판정이 나옵니다. 분석 실험실 대부분에서는 단순하고 노련한 시음가 — 선형 PLS 모델 — 를 이기기 어려운데, 배울 잔이 겨우 수백 개뿐이기 때문입니다. 심층학습 신참은 그 추가적인 영리함이 값할 만큼 되려면 수백만 잔의 저장고가 필요하고, 실험실은 그것을 좀처럼 갖지 못합니다. 기예는 어느 문제가 정말로 그 신참을 필요로 하는지를 아는 것입니다.

이 장에서 다루는 내용

우리는 화학계량학 본령에서 시작합니다 — PLS와 PCA, 분석 실험실의 상용 ML인 선형 잠재변수 방법들을, 실제 분해와 그것을 감싸는 전처리 파이프라인(표준정규변량 standard normal variate, Savitzky-Golay 미분)으로 풀어 쓰며 — 그다음 분광법을 위한 심층학습(라만, NIR, FTIR, 질량분석)으로의 이동을 추적하면서, 1D-CNN 구조와 그것이 도움이 되는 곳과 문제를 찾아 헤매는 해법인 곳을 정밀하게 짚습니다. 우리는 HPLC, CE, SEC를 위한 자동 크로마토그램과 피크 적분을 다루는데, 여기서 기존 강자는 결정론적 신호 처리이고 ML은 가장자리에 도착하고 있습니다. 또 고차원 구조 분석법인 글리칸, 전하 변이체, PTM 특성 분석과, 분석 및 안정성 데이터에서의 이상 탐지를 다룹니다. 우리는 시뮬레이터의 라만 데이터셋 위에서 1D-CNN 대 PLS 정면 대결을 만들고, 이 장에 닻을 내리는 바로잡음을 제기합니다. 그토록 칭송받는 Boehringer Ingelheim의 16속성 라만 연구는 심층학습이 아니라 k-최근접 이웃(k-nearest-neighbors)을 썼으며, 그것을 "심층학습 라만 물결"의 증거로 인용하는 것은 틀렸습니다.

화학계량학: 실험실의 상용 기계학습

화학계량학(chemometrics)은 통계적·수학적 방법을 화학 데이터에 적용하는 것이며 — 바이오파마 실험실에서 그것은 압도적으로 두 알고리즘을 뜻합니다. 부분최소제곱(Partial Least Squares, PLS) 회귀와 주성분분석(Principal Component Analysis, PCA). 둘 다 잠재변수(latent-variable) 방법입니다. 스펙트럼은 넓고 중복적인 객체입니다. 우리 데이터셋의 라만 스캔은 701개의 강도 채널이지만, 그 채널들은 대규모로 상관되어 있습니다 — 인접한 파수들(스펙트럼을 따라 놓인 cm⁻¹ 위치들로, 각각이 한 종류의 분자 진동에 묶임)이 함께 움직이고, 화학은 701개의 독립 차원이 아니라 한 줌의 근저 인자에 깃들어 있습니다. PCA는 분산이 가장 큰 방향들을 찾아 스펙트럼을 몇 개의 주성분(principal components)에 투영합니다. PLS는 표적을 가장 잘 예측하는(역가, 글루코스, 전하 변이체 분획) 방향들을 찾아 그 몇 개의 잠재변수(latent variables)에 회귀합니다.

이것은 바이오공정 ML 역사의 각주가 아닙니다. 그것이 바로 상용 배포입니다. 이 장 전반에 걸쳐, 괄호로 묶은 성숙도 태그가 한 방법이 실제로 얼마나 멀리 왔는지를 매깁니다. (상용)은 상용 GMP 사용에서 일상적임을, (파일럿)은 규모에서 시연되었으나 아직 일상은 아님을, (연구)는 발표되었으나 실험실에 묶여 있음을 뜻합니다. 글루코스, 락트산, 대사물질, 역가(항체가 얼마나 축적되었는지, g/L 단위)를 위한 인라인 라만 플러스 PLS는 폐루프 글루코스 제어를 포함하여 상용 CHO(중국 햄스터 난소 세포, Chinese-hamster-ovary cell) 배양에서 (상용) PAT(공정 분석 기술, Process Analytical Technology — 공정 동안 품질을 실시간으로 측정) 기술입니다 [1][2] — 정직한 비대칭과 함께: 그 루프가 실제로 작동시키는 것은 글루코스 설정점(라만이 검출 바닥 한참 위에서 깨끗하게 읽는 고농도 공급 영양소)이지, 측정 바닥에 훨씬 가까이 앉아 읽기가 더 어려운 품질 속성이 아닙니다. 전체 배치를 지켜보는 다변량 통계적 공정 관리(MSPC) — Sartorius SIMCA / SIMCA-online과 AspenTech ProMV — 는 그 핵심이 PCA와 PLS이며, 지속적 공정 검증, 골든 배치 감시, 결함 탐지에 (상용)입니다 [3][4]. 이 책의 다른 권들이 소프트 센서를 만들 때, 그들은 PLS 모델을 만듭니다. 데이터 책의 소프트 센서 장오픈소스 분석 장은 둘 다 PLSRegression을 중심에 둡니다. 이 장은 그것을 되풀이하지 않습니다. 그것은 다음 질문 — 심층학습이 그것을 이길 수 있는가? — 을 묻고, 정직하게 답합니다.

근거

글루코스/락트산/대사물질/역가를 위한 인라인 라만 + PLS 화학계량 소프트 센서는, CHO 배양에서의 폐루프 글루코스 제어를 포함하여, (상용)이며 독립 동료심사입니다 [1][2]. PCA/PLS를 쓰는 MSPC(SIMCA, ProMV)는 다변량 배치 감시의 (상용) 골격입니다 [3][4]. 이들은 이 책에서 가장 강한 분석 실험실 ML 예시이며, 그것들은 선형 방법입니다 — 이 장의 나머지가 거듭 돌아오는 사실입니다.

수학: PCA와 PLS가 실제로 계산하는 것

마케팅을 벗겨내면 두 방법 모두 행렬 분해입니다. 보정 스펙트럼들을 (n 시료 × 701 파수) 모양의 행렬 X로 쌓습니다. PCA는 그것을 XT Pᵀ로 인수분해하는데, 여기서 점수(scores) T(n × k)는 각 스펙트럼을 저차원 공간에 놓고 적재(loadings) P(701 × k)는 스펙트럼 형상 — 분산이 최대인 방향, 공분산 행렬 XX의 선두 고유벡터로 발견됨 — 입니다. k개 성분(흔히 3~7개의 k)을 유지하면 한 줌의 축으로부터 거의 모든 분산을 재구성합니다. PCA는 결코 표적을 보지 않습니다. 그것은 순전히 스펙트럼이 어떻게 변하는지에 대한 기술(description)이며, 바로 그래서 감시(monitoring)에 적합한 도구입니다 — 그것은 답에 대한 지식 없이 "정상"적인 스펙트럼 형상의 모델을 세웁니다.

PLS는 지도학습 사촌입니다. 그것은 X와 표적 y함께 인수분해하며, 스펙트럼 투영 X wy 사이의 공분산을 최대화하는 잠재 방향 w를 — X 혼자의 분산이 아니라 — 고릅니다. NIPALS 알고리즘은 잠재변수를 한 번에 하나씩 추출합니다. cov(Xw, y)를 최대화하는 가중치 벡터 w를 찾고, 점수 t = Xw를 계산하고, Xy를 모두 t에 회귀하여 적재를 얻고, 둘 모두에서 설명된 부분을 빼(deflate) 다음 성분을 위해 반복합니다. k개 성분 뒤 모델은 길이 701의 단일 회귀 계수 벡터 b(더하기 절편)로 무너지므로 ŷ = X b + b₀입니다. PLS는 k를 단언이 아니라 1-표준오차 규칙(one-standard-error rule — 교차검증 오차가 최선의 1 표준오차 안에 드는 가장 단순한 모델, 곧 성분 수가 가장 적은 모델을 고름으로써 성분 수의 과적합을 막음) 아래 내부 교차검증으로 고릅니다. 이 데이터셋에서 그것은 다섯을 고릅니다. 그래서 우리 PLS가 702개 계수 — 파수마다 하나 더하기 절편 — 를 보고하면서도 실제 자유도는 다섯뿐인 것입니다. 702개의 숫자는 변장한 5계수(rank-5) 객체입니다. 보통 최소제곱은 이렇게 할 수 없습니다. 701개 열과 수백 개 행으로는 XX가 계수 부족이고 역행렬이 없으며, 적합이 불안정하고 계수가 폭발합니다. PLS는 5차원 잠재 공간에서 작업함으로써 역행렬화를 완전히 비껴가는데, 바로 그것이 기초 장(foundations chapter)이 기술한 소량-데이터 영역에서 그것이 살아남는 이유입니다.

커밋된 베이스라인은 그 다섯 성분을 적합하는 데 그치지 않고 — 그것들을 얻어내고 감사합니다. 성분 수를 내부 5겹 교차검증으로 고르는 것(1-표준오차 규칙이 다섯에 안착) 너머로, 그것은 VIP(투영 변수 중요도, Variable Importance in Projection)를 통해 어느 파수에 기대는지를 보고하여 1을 넘는 389개 밴드를 1274 cm⁻¹ 부근에 정점을 두고 표시하며(커밋된 시뮬레이터 운전에서 나온 것이라 예시적), 모든 예측을 훈련 99 백분위수에 설정된 호텔링 T²/SPE 적용 가능 영역(applicability domain, 두 거리 모두 아래 이상 탐지에서 설명됨) 게이트로 통과시킵니다 — 그것은 진짜 떼어둔 스펙트럼을 통과시키고(99 퍼센트 영역 내) 일부러 손상시킨 하나를 표시합니다. 그것이 단지 정확하기만 한 모델과, 옳은 이유로 옳고 자기 깊이를 벗어났을 때를 아는 모델 사이의 차이입니다 — 해부 카드가 나중에 구체화하는 자기 불신입니다.

전처리: SNV와 Savitzky-Golay, 회귀가 아닌 화학계량학의 절반

원시 라만 또는 NIR 스펙트럼은 화학이 보이기도 전에 오염되어 있습니다. 기울어진 형광 기준선(fluorescence baseline)이 라만 피크 아래를 타고 흐릅니다. 빛 산란(light scattering)은 입자 밀도와 프로브 결합에 따라 스펙트럼 전체를 위아래로 배율합니다. 기기 표류는 바닥을 옮깁니다. 이들 중 어느 것도 농도를 나르지 않습니다. 표준 파이프라인은 PLS가 데이터를 보기 전에 적용되는 두 개의 이름 붙은 연산으로 그것들을 제거합니다.

표준정규변량(Standard Normal Variate, SNV)은 스펙트럼별 정규화입니다. 각 스펙트럼에 대해, 701개 채널 전반에 걸친 그 자신의 평균을 빼고 그 자신의 표준편차로 나눕니다. 효과는 모든 스펙트럼을 같은 스케일에 놓아, 시료마다 변하는 곱셈적 산란과 가산적 오프셋을 상쇄하는 것입니다 — 그것은 스펙트럼의 행 단위 z-점수화이며, 역마(workhorse) 산란 보정입니다.

Savitzky-Golay 미분은 기준선을 공략합니다. Savitzky-Golay 필터는 점들의 슬라이딩 윈도(가령 11 또는 15 폭)에 최소제곱으로 저차 다항식(보통 2차)을 적합하고, 윈도 중심에서 평활화된 값이나 그 미분을 읽어냅니다. 1차 미분을 취하면 상수 기준선 오프셋이 제거되고, 2차 미분은 기울어진(선형) 기준선을 제거하고 겹친 피크를 분해 가능한 골로 날카롭게 합니다 — 고주파 잡음을 증폭하는 대가로이며, 바로 그래서 다항식 평활화가 같은 패스에 내장됩니다. 그 조합이 너무 표준적이어서 "SNV 플러스 2차 미분 Savitzky-Golay"는 진동 스펙트럼에 대한 기본 시작 수(opening move)이며, 윈도 폭과 미분 차수를 고르는 것이 수십 년의 영역 지식이 부호화되는 곳입니다. 화학계량학은 절반이 전처리고 절반이 회귀이며, CNN의 매혹적인 호객은 그것이 이 전처리를 학습할 수 있다는 것입니다 — 다음 절이 시험하고 이 장의 코드가 소량 데이터에 대해 반박하는 주장입니다.

분광법을 위한 심층학습: 그 물결, 그리고 정직한 단서

연구 문헌은 스펙트럼 위의 심층학습으로 가득합니다 — 전처리를 손으로 설계하는 대신 스펙트럼 특징을 학습하는 1차원 합성곱 신경망(1D-CNNs), 감시를 위한 변분 오토인코더(VAEs), 질량 스펙트럼을 위한 트랜스포머. 그 호객은 매혹적입니다. CNN은 자신만의 기준선 보정과 특징 추출을 학습할 수 있으니, 화학계량 전처리 기예를 건너뛰고 망이 신호를 찾게 둘 수 있다는 것입니다. Amgen과 다른 이들은 전하 변이체 감시를 포함하여 라만 CQA(핵심 품질 속성, Critical Quality Attribute — 약물이 안전하고 효과적이려면 규격 안에 머물러야 하는 제품 특성) 예측을 위해 CNN과 VAE(변분 오토인코더, variational autoencoders)를 PLS에 맞서 (파일럿) 등급에서 벤치마킹했습니다 [5][6].

1D-CNN이 스펙트럼을 읽는 방법

CNN이 왜 전처리를 학습할 수 있는지 보려면, 그것이 실제로 무엇을 하는지를 보세요. 701개 채널의 스펙트럼은 단일 입력 채널을 가진 1차원 신호로 다뤄집니다 — 그레이스케일 이미지의 유사물이지만, 파수 축을 따라 1차원입니다. 1차원 합성곱(1D convolution)은 작은 커널(가령 15 파수 폭)을 스펙트럼에 가로질러 미끄러뜨리며, 각 위치에서 국소 강도들의 가중합을 계산합니다. 그런 커널 여덟 개로 첫 층은 여덟 개의 특징 지도를 만드는데, 각각이 서로 다른 국소 스펙트럼 모티프(피크 어깨, 기준선 기울기, 이중선)를 강조합니다. 결정적으로, 미분은 고정 커널과의 합성곱이고, Savitzky-Golay 평활도 고정 커널과의 합성곱이므로 — 학습 가능한 가중치를 가진 합성곱 층은 원리상 화학계량학자가 손으로 지정하는 전처리를 학습할 수 있습니다. 그다음 ReLU 비선형성이 음의 응답을 0으로 만들어, 망이 단일 선형 투영이 할 수 없는 것을 표현하게 합니다. 풀링(Pooling)은 다운샘플링합니다. 폭 4에 대한 맥스풀링은 각 윈도에서 가장 강한 응답을 유지하고(작은 피크 이동에 대한 평행이동 관용성), 적응적 평균 풀링은 가변 길이 특징 지도를 고정 크기로 무너뜨려 조밀 헤드가 그것을 읽을 수 있게 합니다. 그런 합성곱-풀 블록 두 개를 쌓으면 특징의 특징을 세웁니다 — 첫 블록의 국소 모티프, 둘째 블록의 모티프 조합 — 그다음 작은 완전연결 회귀 헤드(regression head)가 풀링된 특징을 단일 역가 숫자로 매핑합니다. 이것은 진정한 표현 학습이고, 크고 비선형적인 문제에서는 빛날 것입니다. 문제는 GMP 분광 보정이 문제인가입니다.

정직한 단서

여기 과대광고가 건너뛰는 단서가 있으며, 그것은 이 장의 척추입니다. 심층학습은 데이터가 풍부하고 함수가 복잡하고 비선형일 때 제 값을 합니다. GMP 실험실의 분광법은 그 반대입니다. 진동 스펙트럼과 농도 사이의 관계는 작동 범위에서 선형에 가깝습니다 — 흡수 방법(NIR, FTIR)에서는 흡광도가 투과광의 로그 비인 비어-람베르트(Beer-Lambert)이고, 라만에서는 농도에 정비례하는 산란 강도입니다 — 그리고 데이터는 희소합니다, 보정 집합은 수백만 개가 아니라 수십에서 수백 개의 스펙트럼입니다. 수천 개의 매개변수를 가진 모델은 물어뜯을 것이 없습니다. 그것은 보정 집합에 과적합하고, 더 나쁘게는, 규제자가 신뢰하도록 설득해야 할 블랙박스입니다. 신중한 벤치마크 전반의 패턴은 일관됩니다. 작고 깨끗한 스펙트럼 데이터셋에서 PLS는 심층학습이 잘해야 비기고 언제나 복잡하게 만드는 베이스라인입니다 [7]. 심층학습이 스펙트럼에서 보이는 우위는 대개 무거운 스펙트럼 데이터 증강(훈련 스펙트럼의 합성 이동·산란·기울기 섭동) 아래에서만 나타나며, 잘 최적화된 반복 PLS(iterative-PLS)는 작고 깨끗한 집합에서 그것 없이도 경쟁적으로 남습니다 [7]. 심층학습의 진짜 입구는 더 좁습니다 — 심하게 비선형적인 매트릭스, 기기 사이의 보정 전이(transfer), 또는 스펙트럼을 이미지와 융합하는 것 — 일상적인 라만-대-역가 매핑이 아닙니다.

바로잡음: BI 16속성 라만 연구는 심층학습이 아니라 KNN이었다

한 논문이 너무 자주 인용되고, 너무 자주 잘못 인용되어, 자기만의 문단을 가질 자격이 있습니다. Boehringer Ingelheim은 Protein A 크로마토그래피 동안 16개 품질 속성을 실시간으로 예측하는 로봇 보정을 갖춘 계산 라만을 시연했습니다 — 대략 반 분마다 제품 품질을 감시하는, 진정으로 인상적인 (파일럿) 결과 [8]. 그것은 "심층학습 라만 물결"의 증거로 거듭 소환됩니다. 그것은 심층학습 논문이 아닙니다. 전반적으로 그리고 집계에서 최고로 수행한 모델은 k-최근접 이웃(KNN)이었습니다 — 그 안에 신경망이 어디에도 없는, 고전적이고 비모수적이며 거리 기반인 방법으로, Butterworth-필터 전처리와 짝지어졌습니다. (단편(fragments) 지표에서는 CNN과 SVR이 KNN을 살짝 앞섰지만, KNN이 집계와 전반 오차에서 이겼고, KNN이 표제 방법입니다.) KNN은 매개변수를 적합하지조차 않습니다. 그것은 보정 스펙트럼을 저장하고, 예측 시점에 거리상 가장 가까운 몇 개의 저장된 스펙트럼의 표적을 평균합니다 — 심층망의 대척점입니다. 이 연구를 심층학습이 라만 PAT를 정복했다는 증거로 인용하는 것은 사실 오류이며, 이 책은 그것을 저지르지 않을 것입니다. 오히려 BI 결과는 이 장의 논제를 강화합니다. 실제 바이오공정 스펙트럼에서 단순하고 고전적인 학습기가 심층 학습기들을 이겼습니다.

근거

Boehringer Ingelheim의 16속성 실시간 라만 연구 [8]는 (파일럿)이고, 동료심사를 거쳤으며, 그 전반 최고 모델로 CNN이나 어떤 심층망이 아니라 KNN을 썼습니다. 그것은 이 장에서 가장 강한 근거이며, 고전 화학계량학에 반하는 것이 아니라 편드는 근거입니다. 심층학습 대 PLS 라만 벤치마크(Amgen과 다른 이들)는 (파일럿)/(연구)이며, 전하 변이체와 CQA 예측에서 심층학습이 PLS에 비기는 것이지 결정적으로 이기는 것이 아님을 보고합니다 [5][6][7].

실제 스펙트럼 위의 1D-CNN 대 PLS

이 논증을 펴는 가장 깔끔한 방법은 그것을 돌리는 것입니다. 시리즈 시뮬레이터는 인라인 라만 데이터셋 examples/datasets/raman_spectra.parquet을 내보냅니다. 골든 배치 BATCH-2026-001에서 나온 336개의 시간별 시점이며, 각각이 운동학적 상태 참조 라벨(모델이 예측하도록 훈련되는, 실험실에서 측정한 실측 정답값) — 글루코스, 락트산, 글루타민, VCD(생존 세포 밀도, viable cell density), 그리고 titer_g_L — 과 짝지어진 701채널 스펙트럼(wn_400부터 wn_1800까지, 라만 이동 cm⁻¹)입니다. 우리는 동일한 훈련/시험 분할 위에서 역가를 위한 두 소프트 센서를 만듭니다. 성분 수를 내부 교차검증으로 고르는 — 이 데이터셋에서 다섯 — PLS 회귀(화학계량 베이스라인)와, 스펙트럼을 단일 채널 신호로 다루고 파수에 대한 자신만의 필터를 학습하는 소형 1D-CNN. 그다음 그들을 경주시킵니다.

1D-CNN은 데이터셋이 작기에 의도적으로 작습니다 — 두 개의 합성곱 블록과 작은 회귀 헤드. 그래도 PLS가 다섯 자유도로 제약된 수백 개의 계수를 나르는 곳에서 그것은 수천 개의 매개변수를 나릅니다. 그 구조는 위에서 해부한 바로 그것을 구체화한 것입니다:

# examples/platform/ml/soft_sensor_deep.py — a compact 1D-CNN over the Raman spectrum.
import torch.nn as nn

class SpectraCNN(nn.Module):
"""A compact 1D-CNN: two conv blocks over wavenumber, then a small head."""
def __init__(self, n_wavenumbers: int):
super().__init__()
self.features = nn.Sequential(
nn.Conv1d(1, 8, kernel_size=15, padding=7), nn.ReLU(), # 8 learned filters, width 15
nn.MaxPool1d(4), # tolerate small peak shifts
nn.Conv1d(8, 16, kernel_size=11, padding=5), nn.ReLU(), # features of features
nn.AdaptiveAvgPool1d(8), # collapse to fixed length
)
self.head = nn.Sequential(
nn.Flatten(), nn.Linear(16 * 8, 32), nn.ReLU(),
nn.Dropout(0.2), nn.Linear(32, 1), # regress one titer number
)

def forward(self, x): # x: (batch, 1, n_wavenumbers)
return self.head(self.features(x))

훈련은 표준 지도학습 루프이며, 규제자가 물어볼 바로 그 조각들이기에 그것들을 이름 붙일 가치가 있습니다. 스펙트럼은 훈련 분할에서만 표준화되고(StandardScaler().fit(Xtr)) 그다음 시험에서 재사용됩니다 — 스케일러를 전체 집합에 적합하면 일종의 데이터 누설(data leakage)이 되어, 시험 통계가 훈련으로 스며듭니다. 옵티마이저는 학습률 1e-3의 Adam에 weight_decay=1e-4(L2 정규화, 5,713개 매개변수를 수백 개 행에 과적합시키는 데 대한 망의 방어), 손실은 평균제곱오차, 루프는 고정 시드(torch.manual_seed(2026)) 아래 300 에폭을 돌려 결과가 비트 재현 가능합니다. PLS 쪽은 시리즈의 나머지가 쓰는 같은 화학계량 파이프라인입니다 — SNV와 Savitzky-Golay 전단을 적용하고, 내부 교차검증이 성분 수를 고르게 하고(n_components=select_n_components(Xtr, ytr), 1-SE 규칙 아래 여기서는 다섯), PLSRegression을 적합하고, 떼어둔 조각에서 채점 — 두 모델이 하나의 train_test_split(..., random_state=2026)을 공유하도록 감쌌습니다. 정면 대결 구동기는 둘 다 돌리고 비교를 출력합니다:

# examples/platform/ml/soft_sensor_deep.py — the head-to-head, run with a fixed seed.
from soft_sensor_pls import train_pls # PLSRegression baseline

pls = train_pls() # inner-CV-selected PLS (5 comps) over 701 wavenumbers
cnn = train_cnn(epochs=300) # the SpectraCNN above
print(f" PLS : R2={pls['r2']} RMSE={pls['rmse_g_L']} g/L ({pls['n_params']} coefficients)")
print(f" 1D-CNN : R2={cnn['r2']} RMSE={cnn['rmse_g_L']} g/L ({cnn['n_params']} parameters)")
print(f" PLS uses {cnn['n_params'] / pls['n_params']:.0f}x fewer params and is not beaten on R2.")

python soft_sensor_deep.py를 돌리면 출력합니다(축자 그대로, SIM_SEED=2026, 실행 간 결정론적):

Head-to-head: titer from 701-wavenumber Raman, golden batch BATCH-2026-001
PLS : R2=0.9944 RMSE=0.127 g/L (702 coefficients)
1D-CNN : R2=0.9924 RMSE=0.1488 g/L (5713 parameters)
PLS uses 8x fewer params and is not beaten on R2.

그 결과를 정직한 분석가라면 마땅히 읽을 방식으로 읽으세요. PLS는 R² = 0.9944(RMSE 0.127 g/L)에, 1D-CNN은 R² = 0.9924(RMSE 0.149 g/L)에 안착합니다 — 101개 시험점과 매개변수의 한 토막으로, 선형 모델은 그저 비긴 것이 아니라 근소하게 앞섭니다. 8배 더 많은 매개변수를 가진 심층 모델은 아무것도 사지 못한 데 그치지 않고 정확도까지 치렀으며, 거기에 GPU 모양의 훈련 루프와 규제자에게 검증하고 설명하기 훨씬 어려운 모델을 치렀습니다. 이것이 학습 문제 장(learning-problem chapter)이 이름 붙인 소량-데이터 천장이 실제 스펙트럼 위에서 구체화된 것입니다. 관계가 거의 선형이고 데이터가 희소할 때, 선형 모델은 타협이 아닙니다 — 그것이 옳은 답입니다. 비교를 정직하게 지키는 단서 하나: 이 정면 대결은 배치 내 보간(within-batch interpolation) 시험입니다 — 336개 행 모두가 단일 골든 운전 BATCH-2026-001에서 나오며 무작위 떼어두기로 분할됩니다 — 그래서 그것은 센서가 한 운전 동안 역가를 추적하는지를 재는 것이지 배치 사이를 전이하는지를 재는 것이 아닙니다(배치 간 질문은 transfer.pydrift.py에 삽니다). 두 R² 값이 그토록 높이 앉아 있는 것도 그래서입니다. 시뮬레이터의 스펙트럼이 한 운전 안에서 역가 신호를 깨끗하게 나르기 때문입니다. 실제 라만에서는 두 모델 모두 떨어지지만, 순위 — PLS가 심층학습과 경쟁적이거나 앞섬 — 는 동료심사 벤치마크가 보고하는 바로 그것입니다 [7].

701채널 라만 스펙트럼에서 역가를 얻는 두 소프트 센서를 대비하는 히어로 도해: 왼쪽에는 넓은 스펙트럼이 다섯 개의 잠재 성분으로 압축되어 역가로 선형 회귀하는, 702개 계수 다섯 자유도로 라벨된 청록색 PLS 레인; 오른쪽에는 같은 스펙트럼이 단일 채널 신호로 두 개의 합성곱-풀 블록을 거쳐 작은 조밀 헤드로 들어가는, 5713개 매개변수로 라벨된 보라색 1D-CNN 레인; 두 레인 모두 항등선을 끌어안는 예측-대-측정 산점도로 수렴하며; 바닥을 가로지르는 결과 배너에 PLS R제곱 0.9944 RMSE 리터당 0.127 그램, 1D-CNN R제곱 0.9924 RMSE 리터당 0.1488 그램, 여덟 배 더 많은 매개변수에도 PLS가 여전히 근소하게 앞선다고 적혀 있고; 작고 깨끗한 스펙트럼에서는 선형 모델이 지지 않는다는 작은 곁주석. 그림으로 본 이 장의 논제: PLS 레인(내부 교차검증으로 고른 다섯 잠재 성분, 702개 계수)과 1D-CNN 레인(5713개 매개변수)이 모두 같은 라만 스펙트럼에서 역가를 복원하며, PLS가 떼어둔 정확도에서 심층 모델을 근소하게 앞선다 — 그래서 망은 8배의 매개변수를 쓰고도 진다, 소량-데이터 천장이 눈에 보이게 된다. 저자가 AI의 도움을 받아 직접 제작한 그림입니다.

자동 크로마토그램과 피크 적분

분광법은 실험실의 연속적이고 인라인인 최전선입니다. 크로마토그래피(chromatography)는 그 이산적이고 오프라인인 골격입니다. HPLC, SEC(크기 배제, 단량체/응집체용), CEX(양이온 교환, 전하 변이체용), 그리고 CE(모세관 전기영동)는 모두 크로마토그램(chromatogram) — 시간에 대한 검출기 신호의 자취로, 그 면적이 측정값인 피크들을 가짐 — 을 만듭니다. BATCH-2026-001의 출하 기록은 이것들의 더미입니다. SEC는 98.611 퍼센트 단량체, 1.287 퍼센트 HMW(고분자량 응집체, high-molecular-weight aggregate), 0.439 퍼센트 LMW(저분자량 단편, low-molecular-weight fragment)를 보고합니다. CEX는 70.686 퍼센트 주(main), 21.551 퍼센트 산성(acidic), 10.452 퍼센트 염기성(basic)을 보고합니다 — 그 숫자 하나하나가 곡선에서 적분된 피크 면적이며, 잘못 배분된 면적의 몇 퍼센트가 전하 변이체나 응집체 분획을 그 한계 너머로 옮길 수 있습니다. (모든 출하 숫자가 크로마토그램 피크인 것은 아닙니다. BATCH-2026-004를 100 ng/mg 한계에 대해 128 ng/mg로 규격 미달로 만든 숙주세포 단백질 결과는 적분된 피크가 아니라 ELISA 면역분석법에서 나오며, 피크 적분 문제가 응집과 전하 이질성 분석법을 특정해 다스린다는 것을 일깨웁니다. 잔류 Protein A와 숙주세포 DNA도 마찬가지로 면역분석법과 qPCR로 읽힙니다.)

피크 적분(peak integration)은 각 피크가 어디서 시작하고 끝나는지, 그리고 그 아래로 기준선이 어떻게 흐르는지를 결정하는 행위입니다 — 그리고 그것은 충격적일 만큼 결과를 좌우합니다. 같은 흔들리는 기준선을 적분하는 두 분석가가 작은 어깨가 하나의 피크인지 둘인지에 동의하지 않을 수 있고, 적분 면적의 몇 퍼센트가 한 속성을 규격 한계 너머로 옮길 수 있습니다. 여기서 기존 강자는 ML이 아닙니다. 주류 크로마토그래피 데이터 시스템 — ApexTrack 알고리즘을 가진 Waters Empower — 은 결정론적 신호 처리(deterministic signal processing)를 씁니다. ApexTrack은 신호의 2차 미분으로 피크를 검출하고(정점은 곡률이 가장 음인 곳이며, 같은 Savitzky-Golay 미분 발상이 다시 나타남), 그다음 임계값과 변곡점 규칙으로 기준선을 구성합니다. 그 결정론은 버그가 아니라 규제적 특징인데, 같은 크로마토그램이 같은 방법 매개변수로 언제나 같은 면적으로 적분되기 때문입니다 — 결과는 구성상 재현 가능하고 감사 가능합니다 [9]. ML이 도착하고 있는 곳은 가장자리입니다. 심층학습 피크 적분(Merck KGaA / Bosch CNN 구조, (연구))은 결정론적 알고리즘이 수동 재작업을 필요로 하는 어렵고 잡음 많고 공동 용출하는 피크에서 분석가의 판단을 학습하는 것을 노리며 [10], CDS 벤더들은 피크를 조용히 재적분하는 대신 검토할 가치가 있는 피크로 사람을 부르는 ML 기반 이상 표시를 추가하고 있습니다.

근거

주류 크로마토그래피 피크 적분(Waters Empower ApexTrack)은 결정론적 신호 처리로 남아 있으며 (상용)입니다 — 그 결정론이 그것을 감사 가능하게 만드는 것입니다 [9]. 심층학습 피크 적분(Merck KGaA / Bosch 범용 CNN 구조)은 (연구)입니다 — 시연되었으나 GMP 일상은 아닙니다 [10]. 정직한 독법: ML은 크로마토그래피 검토를 증강하는 것(어려운 피크를 사람 눈에 표시)이지, 출하 숫자를 결정하는 검증된 적분기를 대체하는 것이 아닙니다.

결정론적 기존 강자가 그토록 끈질긴 이유는 다시 같은 주제입니다. 크로마토그래피 출하 숫자는 배치 처분 결정에 입력되므로, 적분은 재현 가능하고, 설명 가능하며, 변경 관리 아래 잠겨 있어야 합니다 — 결정론적 알고리즘이 구성상 가지고 학습된 것은 얻어내야 하는 바로 그 성질들입니다. Merck KGaA / Bosch CNN 연구는 이것에 정면으로 맞서, 모델이 출하 숫자를 무감독으로 내보내게 두는 대신 망이 적분을 제안하고 자격 있는 분석가가 그것을 확인하는 GxP 인간-개입(human-in-the-loop) 틀을 제안합니다. EU/PIC/S GMP 초안 Annex 22(AI에 관한 EU/PIC/S GMP 초안 규칙으로, 중대 작업에는 잠기고 비적응적인 모델만 허용)는 적응형/생성형 AI를 중대 GMP 작업에서 배제하는 날카로운 선을 긋고 사전 결정된 변경 관리 계획을 갖춘 잠긴 모델을 요구하는데 [11], 학습하면서 행동이 바뀌는 적분기야말로 정확히 그 선이 다루는 것입니다.

글리칸, 전하 변이체, PTM 특성 분석

가장 어려운 분석법은 구조적인 것들입니다. 크로마토그램이나 질량 스펙트럼이 하나의 숫자가 아니라 제품 변이체의 전체 프로파일을 나르는 곳입니다. 글리코실화(glycosylation) — 항체의 Fc를 장식하는 당 사슬 — 는 효과기 기능(effector function)과 청소율(clearance)을 조율하기에 CQA입니다. 핵심 비푸코실화(core afucosylation)는 FcγRIIIa 결합과 ADCC 효능을 날카롭게 높이고, 고만노스(high-mannose)와 갈락토실화/시알릴화는 반감기와 보체 활성을 옮깁니다 — 요컨대 당 패턴이 항체가 면역 살해를 얼마나 강하게 동원하는지와 몸이 얼마나 빨리 그것을 청소하는지를 조율하며, 그래서 글리칸 프로파일이 핵심 품질 속성인 것이고, 글리칸 지도는 피크의 숲이자 결과의 숲입니다. (이 용어들 뒤의 물리적 당생물학은 1권의 분석 및 제형 장에 펼쳐져 있습니다.) 전하 변이체(charge variants)(CEX가 분해하는 산성·염기성 종, BATCH-2026-001에서 21.551과 10.452 퍼센트)와 탈아마이드화 및 산화 같은 번역후 변형(post-translational modifications, PTMs)질량분석(mass spectrometry)으로 읽히며, 점점 더 다속성 방법(Multi-Attribute Method, MAM)을 통합니다 — 한 번의 운전에서 많은 제품 품질 속성을 보고하는 LC-MS로, 공정이 전에 만들지 않은 어떤 새 종이든 잡아내는 자동 신규 피크 검출(New Peak Detection, NPD)을 갖춥니다 [12].

여기가 차원수가 진정으로 학습을 부르는 곳입니다. 질량 스펙트럼은 고차원이고 당펩타이드 분절 패턴은 복잡하므로, 심층학습은 진짜 (연구) 등급의 견인력을 가집니다. 당단백질체학(glycoproteomics)을 구동하기 위해 당펩타이드 탠덤 질량 스펙트럼을 예측하는 BERT 스타일 트랜스포머 모델 — 라만-대-역가 매핑이 결여한 두 성질, 곧 풍부한 데이터와 진정으로 복잡하고 비선형적인 구조-대-스펙트럼 매핑을 가진 문제 — [13]과 심층학습 보조 글리칸 데이터베이스 검색입니다. 그러나 성숙도 간극에 주목하세요. MAM의 상용 신규 피크 검출은 대체로 알고리즘/특징 기반(참조 운전에 대한 피크 매칭과 강도 임계값 규칙)이지 심층학습이 아니며, ML은 검증된 핵심을 대체하기보다 그 위에 얹힙니다 [12]. 심층학습 글리칸 연구는 GMP 로트 출하가 아니라 발견과 특성 분석에 삽니다. 패턴은 유지됩니다. 데이터가 풍부하고 구조가 진정으로 복잡한 곳(질량 스펙트럼)에서 심층학습은 발판을 가지고, 숫자가 출하를 가두는 곳(BATCH-2026-001의 분석 성적서상 적분된 전하 변이체 분획)에서는 검증된 고전 방법이 여전히 다스립니다.

분석 및 안정성 데이터에서의 이상 탐지

모든 분석 학습 작업이 소프트 센서인 것은 아닙니다. 큰 부류는 이상 탐지(anomaly detection)입니다 — 다른 것들과 같아 보이지 않는 분석 결과, 크로마토그램, 또는 안정성 추세를, "이것이 나쁘다"는 라벨된 훈련 집합 없이 표시하는 것인데, 실제 실패는 직접 학습하기에 너무 드물기 때문입니다. 이것은 비지도(unsupervised) 학습입니다. 좋은 운전들에 "정상"의 모델을 적합하고, 각 새 운전이 그 정상으로부터 얼마나 멀리 앉아 있는지를 채점합니다. MSPC에서 이것은 정확히 오픈소스 분석 장(open-source analytics chapter)에서 온 호텔링 T²와 제곱 예측 오차(SPE/Q) 기계장치입니다 — 정상 배치들의 PCA 모델로, 새 배치의 모델 평면 밖 거리가 진정으로 새로운 행동을 표시합니다. 두 거리는 두 다른 질문에 답합니다. 는 시료가 모델 평면 에서 보정 구름으로부터 얼마나 멀리 앉아 있는지(알려진 궤적 위의 비정상적으로 높은 글루코스 측정값처럼, 극단적이지만 알아볼 수 있는 값)를 재고, SPE/Q는 평면 의 잔차(모델이 재구성할 수 없는 형상의 스펙트럼 — 보정이 결코 본 적 없는 진정으로 새로운 사건)를 잽니다. 한 점이 하나에서는 정상이고 다른 하나에서는 경보적일 수 있습니다. 더 새로운 (연구) 작업은 같은 일을 위해 LSTM 오토인코더와 격리 숲(isolation forests)으로 밀고 나갑니다 [6].

안정성과 유통기한 데이터는 별개의, 그리고 시사적인 하위 사례입니다. CQA가 수개월의 저장에 걸쳐 어떻게 표류할지 예측하는 것은 소량 데이터에 외삽이 무거운 문제입니다 — 정확히 순수 블랙박스 ML이 위험하고 베이즈 위계(Bayesian hierarchical) 모델(Merck & Co.의 HPV 백신 유통기한 연구, (연구))이나 기계론적 운동학 모델(아레니우스 식 열화 운동학)이 이기는 영역인데, 구조가 희소한 데이터가 할 수 없는 외삽을 나르기 때문입니다 [14]. 베이즈 위계 모델은 로트 전반에 정보를 풀(pool)합니다 — 각 로트가 자기만의 열화 속도를 얻지만, 그 속도들은 공유된 집단 분포에서 뽑히므로, 시점이 몇 개뿐인 로트가 잡음 많은 두 점 선에서 외삽하는 대신 다른 로트들로부터 강도를 빌립니다. 그것은 이 책 전체가 펴는 하이브리드 모델링 논증을, 냉장고에 앉아 있는 바이알의 시간선에 적용한 것입니다.

화학계량 소프트 센서 예측 기록의 해부

PLS 라만 모델이 실시간 스펙트럼 위에서 발화하면, 그것은 헐벗은 3.8을 내보내지 않습니다. 이 시리즈의 모든 산출물처럼, 그 값은 그것과 함께 다니는 것만큼만 신뢰할 수 있습니다 — 그리고 화학계량 예측에 그것은 스펙트럼, 전처리, 잠재 투영, 불확실성, 그리고 그것을 채점할 결국의 참조 분석법을 뜻합니다. 심사자가 할 방식으로 예측 하나를 풀어 헤쳐 보세요.

화학계량 소프트 센서 예측 기록 하나를 풀어 헤치는 신분증: 결합된 데이터셋 해시와 함께 모델 raman_titer_pls v5c를 명명하는 남색 헤더; 타임스탬프, 원시 701채널 입력 스펙트럼, 기준선·산란 보정된 전처리 스펙트럼, 다섯 개의 PLS 잠재변수 점수, 그리고 동결된 회귀 계수를 위한 입력 행들; 예측된 역가를, 함께 예측 구간과 신규성 플래그로 작동하는 모델 내 거리인 호텔링 T제곱과 모델 밖 거리인 제곱 예측 오차와 함께 담은 녹색 핵심 블록; 지연된 오프라인 참조 분석법, 잔차, 그리고 오염되거나 기포에 맞은 프로브를 표시하는 입력 품질 상태를 위한 조정 행들; 기록을 그 훈련 보정 집합, 그것이 검증되는 참조 방법, 그것이 입력하는 MSPC 차트, 그리고 재검증 트리거에 잇는 보라색 관계 패널; 두 거리가 두 다른 질문 — 집단 내 극단성 대 진정한 신규성 — 에 답한다고 짚는 캡션. 하나의 화학계량 예측은 기록 전체다: 그것을 입력한 스펙트럼, 그것을 변환한 전처리와 다섯 개의 잠재 점수, 그 두 MSPC 거리(모델 내 극단성을 위한 호텔링 T², 모델 밖 신규성을 위한 SPE/Q)와 짝지어진 추정값, 오염된 프로브를 불신하는 입력 품질 상태, 그리고 결국 잔차를 드러낼 지연된 참조 분석법. 저자가 AI의 도움을 받아 직접 제작한 그림입니다.

이 카드를 위에서 아래로, 항목별로 읽으세요. 기록은 네 띠로 나뉩니다. 정체성, 핵심 추정, 조정, 그리고 관계.

  • 헤더 — model: raman_titer_pls, 버전 v5c, dataset_hash. 모델 정체성은 버전이고 그것이 적합된 정확한 보정 집합의 해시입니다. 두 예측은 같은 잠긴 모델에서 나왔을 때만 비교 가능합니다. 해시는 감사자가 어느 PLSRegression(n_components=5)이 숫자를 만들었는지 증명하게 해 주는 것이며, ICH Q14(분석 절차 생애주기에 관한 국제 가이드라인)의 생애주기 기대가 변경 기록을 붙이는 닻입니다.
  • timestamp. 스펙트럼이 획득된 때 — 참조 분석법이 도착할 때와 구별되는데, 참조가 지연되기 때문에 중요합니다(잔차는 그것이 도착하기 전까지 계산될 수 없습니다).
  • input_spectrum(원시, 701개 강도). 프로브가 내보낸 그대로의 값싸고 빠른 신호로, 형광 기준선과 산란이 온전합니다. 모든 하류 변환이 그것으로부터 재현 가능해야 하므로 원시로 저장됩니다.
  • preprocessed(기준선·산란 보정됨). SNV와 Savitzky-Golay 이후의 같은 스펙트럼 — PLS가 실제로 소비한 형태. 심사자가 모델이 본 것을 추론하는 게 아니라 정확히 볼 수 있도록 따로 저장됩니다.
  • latent_scores(5개 값). 5차원 PLS 잠재 공간에서의 스펙트럼 좌표 — t 점수. 이것들이 T²와 SPE 거리가 계산되는 대상이며, 701개 채널을 이 시료에 대한 모델의 관점을 나르는 다섯 개의 숫자로 압축합니다.
  • coefficients(동결됨). 보정에서 동결된 702-숫자 회귀 벡터. 동결이 작동어입니다. 초안 Annex 22 아래 중대 GMP 모델은 잠겨 있어야 하므로, 이 계수들은 예측 사이에 움직이지 않습니다.
  • 핵심 — titer_predicted_g_L. 추정값 자체, 가령 3.8 g/L. 헐벗은 소프트 센서는 여기서 멈춥니다. 통치된(governed) 것은 그러지 않습니다.
  • 핵심 — hotelling_t2. 모델 내 거리: 이 스펙트럼의 잠재 점수가 보정 구름의 중심으로부터 얼마나 멀리 앉아 있는지를, 관리 한계에 대해 잰 것. 높은 T²는 "극단적이지만, 내가 알아보는 종류의 시료"라고 말합니다.
  • 핵심 — spe_q. 모델 밖 잔차: 다섯 성분이 재구성할 수 없었던 스펙트럼의 부분을, 그 자신의 한계에 대해 잰 것. 높은 SPE/Q는 "이 스펙트럼은 내가 훈련된 적 없는 형상을 가졌다"라고 말합니다 — 오염된 창, 기포, 새 오염물질. T²와 SPE가 함께 화학계량 모델이 "역가는 3.8"뿐 아니라 "그리고 이 스펙트럼은 내가 훈련된 것들과 닮았다"라고 말하게 해 주는 것입니다 — 데이터 책(data book)이 소프트 센서가 나르고 있어야 한다고 논한 자기 불신입니다.
  • 조정 — reference_value. 공식 숫자인 지연된 오프라인 분석법(HPLC 역가). 소프트 센서는 이것이 도착할 때까지 결정 지원입니다.
  • 조정 — residual. 참조가 도착하면 한 번 계산되는, 예측 빼기 참조 — 모델이 여전히 보정 안에 있는지에 대한 진행 기록.
  • 조정 — status. 시스템이 손상된 스펙트럼 위에서 내린 예측을 신뢰하기보다 자신의 입력을 불신하게 해 주는 입력 품질 판정(가령 ok, probe_fouled, bubble).
  • 관계 — trained_on, validated_against, feeds, revalidates_when. 보정 집합, 모델이 그것에 맞서 자격검증된 참조 방법, 이 기록이 채우는 MSPC 차트, 그리고 재자격검증을 강제하는 트리거(프로브 교체, 규모 변경, 표류 임계값)로의 링크들 — 이 기록을 외톨이 행이 아니라 인스턴스 그래프의 노드로 만드는 네 개의 엣지, 4권이 모델링하는 그 종류입니다.

이 카드가 숫자와 통치된 분석 결과 사이의 차이입니다 — 오픈소스 소프트 센서 기록ICH Q14의 모델 생애주기 기대가 요구하는 바로 그 통치입니다.

기록을 신뢰할 수 있게 만드는 것: 행 아래의 온톨로지

카드를 한 번 더 읽으며, 그 위의 모든 항목이 타입화된 것 — 스펙트럼, 잠재 점수, 참조 분석법, 보정 집합 — 에 대한 주장임에 주목하세요. 그리고 그 각각이 무엇인지, 그리고 그것들이 어떻게 이어지는지를 못 박는 규율이 바로 동반 온톨로지 책이 세우는 바이오공정 온톨로지(ontology)입니다. 그 토대는 장식이 아닙니다. 그것이 애초에 화학계량 모델을 FAIR(Findable, Accessible, Interoperable, Reusable — 찾기 쉽고, 접근 가능하고, 상호운용 가능하고, 재사용 가능)하고 감사 가능하게 만드는 것이며, 부서지기 쉬운 열 이름과 사실 사이의 차이를 얻어냅니다.

  • 열 머리글이 아니라 IRI로 당겨지는 특징. PLS 모델의 latent_scores 행이 앞으로 입력될 때 — MSPC 차트로, 출하 예측기로, 또는 검색 증강 LLM으로 — 그것은 CSV 안의 문자열 "wn_1274"가 아니라 전역 IRI(Internationalized Resource Identifier — 어떤 사물에 대한 전역적으로 고유한 웹 이름)에 묶인 양으로 여행합니다. 온톨로지 책의 식별자 장이 그 논거를 폅니다. BR-101은 이 공장에서는 한 가지를 뜻하고 다음 공장에서는 다른 것을 뜻하는 기본 키이지만, bp:BATCH-2026-001은 어디서나 하나의 배치로 해결됩니다. IRI로 당겨진 특징은 벤더가 태그 이름을 바꾸거나 파수 구간이 이동해도 깨지지 않습니다. 머리글로 당겨진 특징은 조용히 어긋납니다. 그리고 값은 결코 헐벗은 채 여행하지 않습니다 — 역가 3.8은 QUDT 단위(g/L)와 xsd:float 데이터타입을 나르므로, 하류 모델이 리터당 그램을 전하 변이체의 퍼센트와 혼동할 수 없습니다.
  • 출하를 게이팅하는 같은 SHACL 형상이 훈련 집합을 게이팅한다. 모델은 "완전함"에 대한 타고난 개념이 없습니다. 참조 분석법이 조용히 결코 적재되지 않은 스펙트럼 행을 받으면, 그것은 구멍을 메우거나 그 주위로 예측하고 자신만만한 숫자를 보고합니다. 출하 게이트와 SHACL 장이 그 가드를 공급합니다 — 로트가 신뢰되기 전에 모든 필수 CQA가 존재하고, 단일하고, 타입화되고, 범위 안에 있음을 인증하는 폐쇄 세계 bp:ReleaseShape. 같은 형상을 보정 또는 훈련 행 위에 입장 게이트(admission gate)로 돌리면, 비어 있거나 잘못 라벨된 스펙트럼이 깨끗한 라벨로 학습되는 게 아니라 심사자 앞에서 잡힙니다. SHACL은 형식이 올바른 행을 보장하지, 참인 행을 보장하지 않습니다 — 틀린 바이알의 올바른 HMW 값은 여전히 통과합니다 — 이것이 바로 CQA를 건드리는 소프트 센서를 잠긴 모델 변경 관리 아래 자문 역할에 머물게 하는 완전함-아닌-정확함 한계입니다.
  • BFO가 측정을 운전과 별개로 지킨다. 카드의 스펙트럼은 시료의 측정입니다. 그것이 뽑힌 바이오리액터 배양은 공정입니다. 클래스와 분류 장이 그것을 지속체/발생체(continuant/occurrent) 절단으로 그립니다 — 라만 결과(물질이 지니는 품질)는 결코 발효(일어났다가 끝나는 발생체)가 아니고, 용기 BR-101은 결코 그것이 담은 물질 BATCH-2026-001이 아닙니다. 그것들을 뒤섞는 적재기는 틀린 계보를 틀린 노드에 붙이는데, 그것이 바로 형제 스펙트럼이 틀린 배치의 기록으로 새는 방식입니다.
  • 계보 엣지가 교차검증 그룹화 키다. 이 장은 정면 대결이 배치 내 시험임을 직설적으로 말합니다 — 336개 행 모두가 BATCH-2026-001입니다. 정직한 배치 간 평가는 행들이 공유 계보로 그룹화되기를 요구하며, 관계와 계보bp:derivedFrom 척추(owl:TransitiveProperty로 선언된 PROV-O 식 출처 엣지)가 바로 그 그룹화 키입니다. 공유 작업 세포은행 위에서 분할하되 그것을 가로질러 분할하지 마세요. 그러면 그룹/배치-하나-제외 교차검증(grouped / leave-one-batch-out cross-validation)이 한 운전의 형제 스펙트럼이 폴드를 가로질러 새어 점수를 부풀리는 것을 막습니다. 회수를 범위 짓는 같은 전이 엣지가 공정한 모델 평가를 범위 짓습니다. 이것이 배치 내 R² = 0.9944가 보간으로서만 정직한 이유이고, transfer.pydrift.py가 배치 간 질문을 나르는 이유입니다.

교훈은 이 시리즈 전체가 거듭 돌아오는 것입니다. 소프트 센서는 그것이 여행하는 타입화되고, 식별되고, 계보에 닻 내린 기록만큼만 신뢰할 수 있으며 — 온톨로지가 해부 카드를 깔끔한 표에서 심사자와 질의와 모델이 모두 그 위에 설 수 있는 노드로 바꾸는 것입니다.

미해결 과제: 보정 전이와 기기에 묶인 대가

분석 ML의 정직한 미해결 문제는 정확도가 아닙니다 — 그것은 이식성(portability)입니다. 화학계량 모델은 그것이 보정된 정확한 분광기, 프로브, 광섬유, 공정 조건에 묶여 있습니다. 그 묶임은 물리적입니다. 두 프로브는 결코 광학적으로 동일하지 않으므로, 같은 화학이 다른 하드웨어에서 미묘하게 다른 스펙트럼을 만들고, 첫 프로브의 특이점을 학습한 모델은 둘째 프로브의 스펙트럼을 잘못 읽습니다. 프로브를 바꾸거나, 3 L 개발 반응기에서 2,000 L 제조 탱크로 옮기거나, 창이 오염되게 두면, R² = 0.99를 채점하던 모델이 코드 한 줄도 바뀌지 않은 채 수용 기준 너머로 열화할 수 있습니다. 문헌은 그 규모에 대해 직설적입니다. 통제된 연구에서, 같은 라만 분석기의 두 프로브가 같은 배양에서 같은 시각에 순전히 기기 간 차이만으로 세포 밀도에서 대략 20 퍼센트 의견이 갈렸고, 그것을 대략 10 퍼센트로 반감시키는 데 보정 전이 단계가 필요했습니다 [15].

표준 해법은 이름과 수학을 가집니다. 보정 전이(Calibration transfer)는 한 기기의 스펙트럼을 다른 기기의 것으로 매핑하여 원래 모델이 여전히 적용되게 합니다. 조각별 직접 표준화(Piecewise direct standardization, PDS) — 그 연구의 방법으로, Kennard-Stone 시료 선택과 짝지어짐 — 는 2차(secondary) 기기의 각 파수에 대해 1차(primary) 기기의 인접 파수 윈도로부터 작은 국소 회귀를 적합하여, 2차 스펙트럼을 1차의 틀로 다시 쓰는 변환 행렬을 세웁니다. 그것은 능동적이고 미해결인 연구 최전선인데, 모든 새 전이가 자기만의 표준화 시료를 필요로 하고 매핑이 조건이 표류하면서 열화하기 때문이며, 새 하드웨어로 옮긴 소프트 센서가 규제 목적상 재자격검증되기 전까지 새로운 분석 절차인 이유입니다.

이것은 또한, 역설적으로, 심층학습이 진정으로 도울 수 있는 곳 중 하나입니다. 기기 불변(instrument-invariant) 특징을 학습하는 망은 고정된 PLS 보정이 못 하는 곳에서 전이할 수 있습니다 — 심층학습의 우위가 상상이 아니라 실재인 풍부한 데이터, 복잡한 매핑 영역입니다. 그러나 그 약속은 (상용)이 아니라 (연구)이며, 그것은 검증의 벽으로 곧장 부딪칩니다 — 새 기기에 적응하는 모델은, 초안 Annex 22의 논리상, 정확히 중대 GMP 작업에서 배제된 종류의 적응형 시스템입니다 [11]. 따라서 미해결 부분은 진정한 긴장입니다. 기술적 해법(여행하는 모델)과 규제적 자세(잠긴 모델)가 반대 방향을 가리키며, 아무도 그것들을 온전히 화해시키지 못했습니다. 다음 장은 정확히 이 긴장을 주제로 삼습니다.

이 장이 모델 모음에 더하는 것

이 장은 examples/platform/ml/정면 대결 소프트 센서 쌍을 기여합니다:

  • soft_sensor_pls.py — 화학계량 베이스라인: 701파수 라만 데이터셋 위의 PLSRegression으로, 성분 수는 내부 교차검증으로 고르고(여기서는 1-SE 규칙 아래 다섯), 떼어둔 조각에서 R² = 0.9944과 RMSE = 0.127 g/L를 보고하며, 거기에 VIP 밴드 중요도와 호텔링 T²/SPE 적용 가능 영역 게이트를 더하고, 비교가 공정하도록 시리즈가 쓰는 같은 train_test_split(random_state=2026)을 씁니다.
  • soft_sensor_deep.pySpectraCNN, 소형 PyTorch 1D-CNN(두 합성곱 블록, 맥스풀과 적응적 평균 풀, 드롭아웃이 있는 32-유닛 조밀 헤드)에, 두 모델을 동일한 분할 위에서 고정 시드로 훈련하고 정면 대결을 출력하는 구동기를 더한 것. 그것은 5,713개 매개변수로부터 R² = 0.9924와 RMSE = 0.1488 g/L를 보고합니다 — PLS보다 8배 많은데도 정확도에서 여전히 밀립니다.

함께 그것들은 이 장 논제의 실행 가능한 증명이며, 노트북에서 GPU 없이 결과가 재현 가능하도록 의도적으로 작고 의존성이 가볍습니다(커밋된 parquet 위의 scikit-learn 플러스 PyTorch). 그것들은 또한 생산 바이오리액터 장(production-bioreactor chapter)의 씨앗이 되는데, 거기서 같은 PLS 소프트 센서가 실험실 벤치마크에서 살아 있는 폐루프 제어 요소로 옮겨갑니다.

왜 중요한가

분석 실험실은 바이오 제조의 ML이 가장 오래되었으면서 가장 과대 주장된 곳입니다. 가장 오래되었는데, 화학계량학 — PLS와 PCA — 이 40년 동안 상용에서 돌아왔고 바이오공정 학습의 진정하고 검증된 (상용) 성공담이기 때문입니다. 과대 주장되었는데, 심층학습 문헌이 GMP 실험실에 도달하지 못한 물결을 암시하고, 잘못된 인용(BI 연구를 "심층학습"으로)이 그 인상을 떠받치기 때문입니다. 이 장을 옳게 하는 것은 두 진실을 한꺼번에 붙드는 것을 뜻합니다. 분석 실험실의 기계학습은 실재하고 배포되어 있다 — 그리고 그것은 대체로 선형이다. 다섯 성분 PLS가 매개변수의 한 토막과 검증 부담의 한 토막으로 비기거나 앞서는데도 라만 스펙트럼을 읽으려고 트랜스포머에 손을 뻗는 팀은 신기함을 진보로 착각한 것입니다. 실행 가능한 코드의 정직한 판정이 교훈 전부입니다. 작고 깨끗한 스펙트럼에서는 단순한 모델이 이기고, 어느 분석 문제가 정말로 심층 모델을 필요로 하는지를 아는 것이 진짜 전문성입니다.

실제 현장에서는

상용 mAb 실험실에서 실제로 마주칠 (상용) 분석 ML은 빽빽하게 무리 짓습니다. 인라인 라만 + PLS 소프트 센서가 글루코스, 락트산, 역가를 위해 공정 분석기(Endress+Hauser Kaiser Raman Rxn 헤드) 위에서 돌고, 폐루프 글루코스 제어가 가장 성숙한 배포입니다 [1][2]. MSPC가 배치 감시와 결함 탐지를 위해 Sartorius SIMCA / SIMCA-online과 AspenTech ProMV 위에서 돕니다 [3][4]. 크로마토그래피 데이터 시스템(ApexTrack을 가진 Waters Empower)은 피크를 결정론적으로 적분하고 가장자리에 ML 이상 표시를 추가하고 있습니다 [9]. MAM(Thermo Chromeleon + BioPharma Finder, Genedata, Protein Metrics)은 자동 신규 피크 검출을 대체로 알고리즘적으로 하며, ML이 그 위에 얹히고 있습니다 [12].

(파일럿)/(연구) 최전선은 흥분이 사는 곳이자 성숙도가 떨어지는 곳입니다. Boehringer Ingelheim의 16속성 실시간 라만 연구(KNN, (파일럿)) [8]; 전하 변이체를 위한 CNN/VAE 대 PLS 벤치마크(Amgen과 다른 이들, (파일럿)) [5][6]; 심층학습 피크 적분(Merck KGaA / Bosch, (연구)) [10]; BERT 스타일 당펩타이드 MS 예측 (연구) [13]; 그리고 베이즈/운동학 안정성 예측(Merck & Co., Sanofi, (연구)) [14]. (상용) 대 최전선 선은 선형 대 심층 선 위에 거의 완벽하게 매핑됩니다 — 분석 ML 벤더 회의에 들어갈 때 알아야 할 가장 유용한 단 하나입니다.

핵심 용어

  • 화학계량학(Chemometrics) — 화학 데이터에 적용된 통계적/수학적 방법; 바이오파마에서는 압도적으로 PLS와 PCA. 분석 실험실의 상용 기계학습.
  • PLS(부분최소제곱, Partial Least Squares) — 넓고 공선적인 스펙트럼을, 표적을 예측하도록(y와의 공분산을 최대화하도록) 고른 몇 개의 성분으로 압축한 뒤 그것들에 회귀하는 지도 잠재변수 회귀; 실제 자유도가 적은 계수 벡터로 무너집니다. 화학계량학의 역마.
  • PCA(주성분분석, Principal Component Analysis) — 분산이 가장 큰 방향을 따라 스펙트럼을 점수와 적재로 인수분해하는 비지도 잠재변수 방법; MSPC 배치 감시의 핵심이며, 설계상 표적에 눈먼 것.
  • SNV / Savitzky-Golay — 표준 스펙트럼 전처리: SNV는 각 스펙트럼을 행 단위로 정규화하여 산란과 오프셋을 상쇄하고; Savitzky-Golay는 슬라이딩 다항식을 적합하여 그 1차/2차 미분이 기준선을 제거하고 피크를 날카롭게 합니다. 회귀가 아닌 화학계량학의 절반.
  • 1D-CNN — 스펙트럼을 신호로 다루며 국소 필터(미분은 고정 합성곱)와 ReLU 비선형성과 풀링을 학습하는 1차원 합성곱 신경망; 작고 깨끗한 스펙트럼에서 훨씬 많은 매개변수로도 PLS에 밀리는 심층학습 도전자.
  • MSPC(다변량 통계적 공정 관리, multivariate statistical process control) — 호텔링 T²(모델 안의 거리)와 SPE/Q(모델 밖의 거리)를 통한 전체 배치의 PCA/PLS 감시; SIMCA와 ProMV에서 (상용).
  • 호텔링 T² / SPE(Q) — 두 MSPC 거리: T²는 모델 평면 안에서 극단적이지만 알아볼 수 있는 시료를 표시하고; SPE/Q는 모델이 재구성할 수 없는 형상을 가진 진정으로 새로운 것을 표시합니다.
  • 피크 적분(Peak integration) — 크로마토그래피 피크가 어디서 시작하고 끝나는지, 그리고 그 아래로 기준선이 어떻게 흐르는지를 결정하는 것; 곡선을 출하 숫자로 바꾸는 행위. 상용에서는 결정론적(Empower ApexTrack, 2차 미분 정점 검출); 가장자리에 ML.
  • MAM(다속성 방법, Multi-Attribute Method) — 자동 신규 피크 검출을 갖추고 한 번의 운전에서 많은 제품 품질 속성을 보고하는 LC-MS; 상용 NPD는 대체로 알고리즘적이며, ML이 그 위에 얹힘.
  • 보정 전이 / PDS(Calibration transfer / PDS) — 화학계량 모델을 한 기기에서 다른 기기로 매핑하는 것(조각별 직접 표준화가 2차 스펙트럼을 1차의 틀로 다시 씀); 미해결 이식성 문제이며, 새 하드웨어 위의 모델이 새 분석 절차인 이유.
  • 글리칸 / 전하 변이체 / PTM(Glycan / charge variant / PTM) — 크로마토그래피와 질량분석으로 읽히는 구조 CQA(당 사슬, 산성/염기성 종, 탈아마이드화/산화); 심층학습이 연구 발판을 가진 곳.
  • KNN(k-최근접 이웃, k-nearest-neighbors) — Boehringer Ingelheim의 16속성 라만 연구에서 최고 모델이었던 고전적이고 비모수적인 방법(보정 스펙트럼을 저장하고, 가장 가까운 몇 개의 표적을 평균) — 따라서 그것은 심층학습 결과가 아닙니다.
  • 시맨틱 그라운딩(Semantic grounding, IRI / QUDT) — 부서지기 쉬운 CSV 열 머리글이 아니라 바이오공정 온톨로지로부터 전역 식별자와 단위 타입화된 값으로 특징을 당기는 것; 화학계량 모델을 FAIR하게 만들고, 이름이 바뀐 태그나 이동한 파수 구간이 특징 행을 조용히 오염시키는 것을 막는 규율.
  • 입장 게이트(Admission gate, 훈련 행 위의 SHACL) — 모델이 학습하기 전에 보정 또는 훈련 행 위로 폐쇄 세계 출하 형상(bp:ReleaseShape)을 돌려, 비어 있거나 잘못 라벨된 스펙트럼이 심사자 앞에서 잡히게 하는 것; 그것은 정확함이 아니라 완전함을 인증하며, 그래서 CQA를 건드리는 소프트 센서가 자문 역할에 머무는 것.
  • 그룹/배치-하나-제외 교차검증(Grouped / leave-one-batch-out cross-validation) — 무작위가 아니라 공유 bp:derivedFrom 계보(작업 세포은행 키) 위에서 평가를 분할하여, 한 운전의 형제 스펙트럼이 폴드를 가로질러 결코 새지 않게 하는 것; 회수를 범위 짓는 같은 전이 출처 엣지가 공정한 점수를 범위 짓고, 이 장의 배치 내 R²가 보간으로서만 정직한 이유.

다음 이야기

실험실 벤치에서 PLS에 맞먹는(여기서는 근소하게 앞서기까지 하는) 모델은 한 가지이고, 3 L 개발 반응기에서 2,000 L 제조 탱크로의 도약을 살아남아야 하는 모델은 또 다른 것이며, 이 장이 끝낸 보정 전이 문제는 정확히 그 도약을 축소판으로 담은 것입니다. 다음 장 기술 이전과 규모 확대: 규모 사이를 여행하는 모델은 그 질문을 정면으로 다룹니다. 학습된 모델 — 소프트 센서, 공정 모델, 제어 정책 — 이 그것이 훈련된 규모에서 그것이 돌아야 할 규모로 여행한다는 것은 무엇을 뜻하며, 어느 모델링 선택이 모델을 기기에 묶이는 대신 이식 가능하게 만드는가.