본문으로 건너뛰기

벤더 지형: 누가 무엇을 팔며, 무엇이 진짜인가

📍 현재 위치: 7부 · 오늘날 산업 현장의 ML/AI — 25장. 앞 장은 생성형 AI와 LLM(generative AI and LLMs)을 저울질하여 코파일럿(통제권을 쥔 인간을 보조하는 AI)은 유용하지만 에이전트(자율적으로 행동하는 AI)는 과대 판매되었다고 보았습니다. 이 장은 이 책의 모든 기법을 파는 시장으로 끝까지 줌아웃하여, 구매자가 던져야 할 유일한 질문을 묻습니다. 이 모든 것 중에서, 무엇이 실제로 진짜인가?

스물네 개의 장이 학습 렌즈를 통해 바이오공정의 등뼈를 걸으며, 그 길에서 알고리즘과 데이터셋, 그리고 몇 개의 명명된 배포를 짚어 왔습니다. 그러나 공정 과학자는 알고리즘을 사지 않습니다. 그들은 제품 — 라이선스, 지원 계약, 검증 패키지, 감사의 반대편에 있는 벤더 — 을 삽니다. 이 장은 구매자의 지도입니다. 바이오 제조 소프트웨어 시장 전반에서 누가 무엇을 파는지 열거하고, 이 책이 처음부터 써 온 바로 그 정직한 성숙도와 증거 등급으로 각 제공물을 정렬하며, 지도 전체에서 단연 가장 중요한 한 선을 긋습니다. 일상적 GMP(Good Manufacturing Practice — 모든 의약품 제조가 따라야 하는 구속적 품질 규정) 상용에서 시연된 것과 시연을 앞질러 달리는 에이전트 마케팅 사이의 선입니다.

지금 시장은 시끄럽습니다. 모든 벤더가 "AI 생태계"를 갖고 있고, 모든 보도자료에 백분율이 붙으며, "에이전트(agentic)"는 십 년 전 "클라우드"가 그랬던 단어가 되었습니다. 그 소음 아래, 상용급 현실은 마케팅보다 더 좁고 더 오래되었습니다. 다변량 감시, 분광 소프트 센싱, 컴퓨터 비전 검사, 그리고 인간-개입(human-in-the-loop) 문서화 — 그 대부분이 심층학습 시대보다 앞선 수학 위에 세워져 있습니다. 이 책이 거듭한 정정들은 바로 여기서, 슬라이드 위에서 가장 틀리기 쉬운 곳에서 가장 중요합니다.

쉽게 말하면

바이오 제조 AI를 사는 것은 2026년에 자율주행차를 사는 것과 같습니다. 브로슈어는 어디든 스스로 운전하는 차를 보여 주지만, 작은 글씨는 "운전자 보조 기능, 손은 핸들 위에"라고 말합니다. 정직한 구매자는 헤드라인을 지나 운영 설계 영역(operational design domain) 까지 읽는 법을 배웁니다 — 정확히 어디서 이것이 무인으로 실제 작동하고, 어디서 여전히 사람이 조종하고 있는가? 이 장은 바이오공정 소프트웨어 시장을 그렇게 읽는 법을 가르칩니다. 어떤 제품이 출하 결정을 내리며 GMP 공장에서 진정으로 돌아가고, 어떤 것이 로드맵이 붙은 매우 좋은 데모인가.

이 장에서 다루는 내용

  • 네 개의 증거 등급과 세 개의 성숙도 표지를, 논문이 아니라 시장에 적용하기
  • MVDA/PAT(다변량 데이터 분석 / 공정 분석 기술, multivariate data analysis / process analytical technology) 기성 기업들(Sartorius, AspenTech/Emerson) — 진정으로 상용급인 핵심
  • 기계론 및 하이브리드 전문가들(Cytiva GoSilico, DataHow, Yokogawa/Insilico) — 그리고 모두가 틀리는 두 가지 귀속
  • GxP-AI SaaS(서비스형 소프트웨어로서의 우수규범-규제 AI, good-practice-regulated AI as software-as-a-service)와 데이터-계층 주자들(Aizon, TetraScience, Ganymede)
  • ML이 네이티브가 아니라 위에 얹히는 자동화 및 MES(제조 실행 시스템, manufacturing execution system) 기성 기업들(Korber, Siemens, Rockwell, Emerson, AVEVA)
  • 소모품-그리고-지능 회사들(MilliporeSigma/Merck, Thermo Fisher), CDS/QC(크로마토그래피-데이터-시스템 / 품질 관리, chromatography-data-system / quality-control) 도구(Waters), 그리고 검증/품질 스택(ValGenesis, Veeva)
  • 통합 지도 — 누가 누구를 샀는가 — 와 그것이 슬라이드 위의 귀속을 바꾸는 이유
  • "에이전트" 마케팅이 어떻게 시연된 상용을 앞질렀는가, 그리고 Purolea 경고 서한이 그 간극에 무엇을 했는가
  • 모든 독점 상자에 맞서는 재현 가능한 반례로서의 오픈소스 예제 모음

벤더 주장을 읽는 법: 등급, 성숙도, 그리고 헤드라인 숫자

이 장의 모든 주장은 두 개의 라벨을 지니며, 책의 나머지가 쓰는 바로 그 두 개입니다. 증거 등급(evidence tier) 은 주장이 어떻게 확립되었는지를 말합니다. 독립 동료심사(저널, 상업적 이해관계가 없는 저자들), 자체 저자 동료심사(저널이지만 벤더나 고객이 공저자), 벤더 자체보고(제품 페이지, 백서, 또는 학회 슬라이드), 또는 보도자료 한정(뒷받침하는 방법론이 없는 발표). 성숙도 표지(maturity marker) 는 그것이 실제로 얼마나 멀리 갔는지를 말합니다. (상용) GMP나 상업 제조에 배포됨, (파일럿) 규모에서 시연되었으나 일상적 출하에는 아님, (연구) 학술 또는 초기 단계.

두 라벨은 독립적이며, 그 둘 사이의 간극이 구매자가 돈을 잃는 곳입니다. 벤더는 진정으로 (상용) 인 제품을 가지면서도 그 대표 숫자벤더 자체보고일 수 있습니다 — 배포는 진짜이고, 백분율은 마케팅입니다. 이 장이 강제하는 규율은 성숙도 표지가 증거 등급으로부터 신뢰성을 빌려 오거나, 그 반대를 하도록 결코 허용하지 않는 것입니다. 벤더 페이지가 어떤 모델이 "실험을 80% 줄였다"고 말할 때, 그것은 플랫폼이 얼마나 상용급이든 관계없이 벤더 자체보고 수치입니다 [1]. 벤더와 그 고객이 공저한 동료심사 논문이 33%의 정확도 향상을 보고할 때, 그것은 자체 저자 동료심사 입니다 — 제품 페이지보다 강하고 독립 재현보다 약하며, 벤더 페이지 자신의 더 큰 숫자보다 우선하여 인용해야 할 수치입니다 [2].

어느 라벨보다 더 많은 나쁜 슬라이드를 잡아내는 세 번째의, 더 조용한 시험이 있습니다. 주장의 분모와 반사실(counterfactual) 입니다. "검증 80% 더 빠름"은 무슨 베이스라인보다 더 빠르고, 어떤 범위에서 측정되었으며, 누구의 공정에서인가? 명시된 비교 대상이 없는 수치는 약한 측정이 아닙니다 — 그것은 아예 측정이 아니며, 결과가 아니라 마케팅 목표로 읽혀야 합니다. 능력배포와 혼동하는 것도 마찬가지입니다. 연속 학습을 "지원"하는 벤더는 GMP에 결정적인 루프에서 연속 학습 모델을 돌리는 벤더와 같지 않으며, 초안 EU/PIC/S GMP Annex 22(곧 나올 유럽 및 국제 제조-AI 규칙으로, 아래에서 상술)가 그 구분을 법적으로 짐을 지게 만듭니다. 분모, 비교 대상, 또는 범위를 찾을 수 없을 때는, 품질 부서가 문서화되지 않은 결과를 다루듯 그 숫자를 다루세요. 증거가 아니라, 증거를 기다리는 가설로.

증거

2026년 중반 현재, 어떤 상업용 바이오공정 AI 효율 헤드라인에 대해서도 독립 동료심사 증거는 거의 없습니다. 가장 강한 독립 신호는 수치적이 아니라 구조적입니다. 제7차 ISPE(국제제약공학회, International Society for Pharmaceutical Engineering) Pharma 4.0 설문은 — Pharma 4.0은 디지털하고 데이터 주도적인 공장에 대한 업계의 이름입니다 — AI/ML이 파일럿 프로젝트가 가장 많고 규모화된 구현이 가장 적은 기술임을 발견했습니다 — 그것은 빅데이터 분석, 고급 분석, 로봇 프로세스 자동화, GxP 클라우드, 그리고 IIoT(산업 사물 인터넷 — 공장 현장의 네트워크화된 센서와 장비) 뒤에 처지며, 이들 모두 제약에서 이미 더 성숙해 있습니다 [3]. 이 장의 모든 벤더 헤드라인을 그 배경에 비추어 읽으세요. 시장은 대부분의 공장이 아직 끝내지 못한 여정의 종착 상태를 팔고 있습니다.

MVDA와 PAT 기성 기업들: 상용급 핵심

바이오 제조 AI가 실제로 출하될 때 어떻게 생겼는지 알고 싶다면, 시장에서 가장 오래된 제품들을 보세요. 다변량 통계 공정 감시(multivariate statistical process monitoring) — 배치 궤적 위의 PCA와 PLS(아래 분석 장이 만드는 차원 축소 및 회귀 방법)를, 호텔링 T-제곱(Hotelling's T-squared)과 제곱 예측 오차(배치가 정상 군집에서 벗어날 때 표시하는 두 거리 척도)로 채점하고, 기여도 플롯(어느 입력 변수가 그 벗어남을 일으켰는지)으로 진단하는 것 — 은 업계 전반에서 명백히 (상용) 인 유일한 기법이며, 이십 년째 그래 왔습니다. 이 책은 Book 3의 분석 장(Book 3's analytics chapter)에서 이미 그 오픈소스 핵심을 만들었습니다. 상업용 기성 기업들은 같은 수학을 두른, 제품화되고 검증된 래퍼입니다. MVDA(다변량 데이터 분석, multivariate data analysis)가 시장의 유일한 진정한 상용-전반 AI인 이유는 알고리즘이 특별해서가 아니라 규제 경로가 닦여 있기 때문입니다. 다변량 모델은 일단 적합되면 정적이고 결정론적이며, 그 출력(T-제곱 거리, 기여도 플롯)은 검사 가능하고 재현 가능하며, EMA와 FDA(유럽 및 미국 의약품 규제 당국)가 이미 실시간 출하 시험(Real-Time Release testing, RTRT — 라인-끝 실험실 시험을 기다리는 대신 공정 중 모델 예측으로 배치를 출하하는 것)을 규제 경로로서 인정합니다. (QC-그리고-출하 장(QC-and-release chapter)이 신중히 짚듯, 그 인정은 방법과 경로에 대한 것입니다 — 완전히 승인된 폐루프 RTRT(루프 안에 인간 없이 모델이 직접 배치를 출하하는 것)는 일상적 GMP에서 여전히 소분자의 현실(예: Janssen의 Prezista — 바이오로직보다 특성화가 단순한, 관행적으로 화학 합성된 약품)이지, 아직 바이오로직-CQA(순도나 역가처럼 규격 안에 머물러야 하는 측정 가능한 속성)에 대해서는 시연되지 않았습니다.) 그 조합 — 오래된 수학, 잠긴 모델, 인정된 경로 — 은 바로 초안 Annex 22가 결정적 결정에 손대려는 어떤 새로운 AI에든 요구할 윤곽입니다.

Sartorius는 Umetrics 라인을 통해 시장 표준입니다. 오프라인 다변량 모델링과 황금 배치(golden-batch) 지문화를 위한 SIMCA, 실시간 공정 감시를 위한 SIMCA-online, 그리고 실험 설계를 위한 MODDE [4]. 이들은 지속 공정 검증(Continued Process Verification, CPV — 검증된 공정이 통제 상태에 머무는지 지속적으로 감시하는 것)과 결함 탐지를 위해 상업적 GMP 공장에서 돌아가는, 21 CFR Part 11 환경(전자 기록과 전자 서명을 규율하는 미국 규칙)용으로 검증된 진정한 (상용) 도구입니다. Sartorius의 더 넓은 "Umetrics Digital Twin AI Ecosystem"과 "Biobrain" 포지셔닝은 더 새롭고 벤더 자체보고 입니다 — MVDA 핵심은 입증되었고, AI 생태계 브랜딩은 그 위에 얹힌 마케팅 층입니다. 시장 전체에서 가장 깨끗한 상용 닻이 여기 자리합니다. 푸에르토리코의 Amgen Juncos 시설이 수확-역가(배양 끝의 항체 농도)와 공정 중(in-process) 속성을 예측하는 SIMCA OPLS(직교 PLS, PLS 변형) 모델을 상업적 GMP에서 돌리며, 배치당 대략 여섯 시간의 수확 유휴 시간과 열 시간의 컬럼 유휴 제거를 보고합니다 — 그러나 그것은 제1자(first-party) 벤더 자체보고 수치이며(Sartorius를 사례 연구 후원자로 둔 Amgen 엔지니어들), 그 시간 절감은 외부적으로 검증 가능하지 않습니다 [5]. Juncos 사례가 무엇이고 무엇이 아닌지에 주목하세요. 그것은 진짜 상업적 GMP 안의 진짜 모델이고(성숙도는 진정으로 상용이며), 그것이 배포하는 기법은 OPLS — 신경망이 아니라 다변량 회귀 — 입니다. 시장에서 가장 강력한 상용 AI는 이 책에서 가장 유행에 뒤떨어진 수학입니다.

또 다른 상용급 MVDA 회사는 AspenTech ProMV(이전 ProSensus/MacGregor)로, Emerson이 AspenTech를 대략 백오십억 달러 규모로 움직인 뒤 이제 Emerson 안에 있습니다 [6]. ProMV는 SIMCA가 하는 것과 같은 결함 탐지와 기여도 플롯 진단을 하며, 그 "황금 배치의 오류(fallacy of the golden batch)" 비판은 순진한 단일-참조-궤적 발상에 대한 유용한 교정입니다 — 상용급 핵심조차 벤더 자신이 문서화하는 알려진 실패 모드(과적합된 참조 배치)를 가졌다는 상기입니다. Emerson 자체의 DeltaV PredictPro는 모델-예측 및 분석 기능을 DCS(분산 제어 시스템, distributed control system — 장비를 돌리는 자동화 계층) 계층으로 가져옵니다. 그 모든 것이 감시에는 (상용) 이지만, 어느 것도 결정적 품질 속성(critical quality attribute, CQA)의 자율 제어는 아닙니다. MVDA 등급 전체에 대한 정직한 요약은 한 문장입니다. 그것은 공정을 지켜보고 인간이 행동하도록 편차를 표시하며, 바로 그것이 그것이 닫아야 할 에이전트 간극이 없는 시장의 부분인 이유입니다.

기계론 및 하이브리드 전문가들: 귀속이 틀어지는 곳

여기가 슬라이드가 소유권을 틀리게 짚는 지도의 부분이며, 그것을 바로잡는 것이 정직한 지형의 전부입니다. 여기의 세 회사는 헷갈리게 비슷한 이름과 헷갈리게 다른 모델 부류를 가졌고, 단 한 번의 오기(mislabel)가 만들지-살지(build-versus-buy) 결정을 조용히 왜곡합니다.

Cytiva(Danaher 회사)는 GoSilico — 2021년에 인수한 ChromX/DSPX 기계론적 크로마토그래피 모델링 스위트 — 를 팝니다 [7]. GoSilico는 CMC 하류 개발에서 (상용) 이며, 이 장에서 단연 가장 중요한 귀속 정정입니다. GoSilico는 기계론적이지, 기계학습이 아닙니다. 그것은 크로마토그래피의 물리 — 수송-분산 물질수지 방정식과 입체-질량-작용(steric-mass-action) 평형 — 를 풀어, 몇 번의 보정 운전으로부터 용리(elution) 거동을 예측합니다. 그것은 하이브리드 모델 장(hybrid-models chapter)의 "백박스(white box)" — 내부가 불투명한 적합 가중치인 "블랙박스(black box)"와 대조적으로, 내부가 물리적으로 해석 가능한 모델 — 이지, 학습된 모델이 아닙니다. 손실을 최소화하도록 적합된 가중치가 아니라 물리적 의미를 가진 매개변수(결합 상수, 컬럼 다공성)를 가지며, 회귀가 외삽하는 방식이 아니라 물리가 외삽하는 방식으로 외삽합니다. 벤더 슬라이드에서 그것을 "AI" 아래에 진열하는 것은 이 책이 거부하는 범주 오류이며, 현학적인 것이 아닙니다 — 기계론적 모델과 ML 모델은 서로 다른 검증 의무, 다른 실패 모드, 그리고 Annex 22 아래 다른 태도(결정론적 물리 솔버는 초안이 결정적 용도로 허용하는 바로 그런 종류의 정적 모델)를 가집니다. GoSilico가 인-실리코(in-silico) 공정 개발에 대해 주장하는 시간 절감은 종류로는 진짜이지만 그 크기에서는 벤더 자체보고 입니다.

DataHow는 순수 하이브리드 모델링 전문가이며, 모두가 틀리는 두 번째 귀속입니다. DataHow는 독립 기업입니다. 그것은 ETH Zurich 스핀오프로, Momenta가 주도하고 Rockwell Automation과 Zurich Kantonal Bank를 포함한 시리즈 A를 받았으며, 2024년 말에 발표된 Eppendorf 협업을 가졌습니다 — 그것은 Sartorius 소유가 아닙니다. 둘 다 바이오공정 분석을 팔고 둘 다 같은 유럽 학술 환경으로 거슬러 가기에 반복되는 혼동입니다 [1]. 그것의 DataHowLabSpectraHow 제품은 하이브리드(기계론-플러스-데이터) 모델링과 전이 학습을 합니다 — 운동학이 놓치는 것을 위한 학습된 잔차를 가진 Monod-스타일 운동학 골격(세포 성장 속도를 영양분 농도에 연결하는 교과서 방정식)으로, 오픈 모음의 hybrid_model 모듈이 축소판으로 만드는 바로 그 기계론-플러스-잔차 구조입니다(거기서 골격은 IVCD-곱하기-비생산성(specific-productivity) 역가 관계 — 생존 세포 밀도의 시간 적분에 세포당 산출을 곱하면 총 산물이 됨 — 이며, Monod 성장 운동학이 구동하는 시뮬레이터 상태 위에 얹힙니다). 제품 페이지는 30에서 60퍼센트 — 최대 80퍼센트 — 적은 실험을 주장합니다. 그 수치 하나하나가 벤더 자체보고 이며, 그 폭 자체(30에서 80퍼센트)가 그 숫자가 어느 베이스라인과 어느 공정을 고르느냐에 크게 의존한다는 단서입니다 [1]. DataHow의 정직한 강력한 닻은 제품 페이지가 아니라, 그 대표적인 Bristol Myers Squibb 사례에 대한 자체 저자 동료심사 동반 논문입니다. DataHow와 BMS가 공저한 Biotechnology Journal(2024) 논문으로, 12개의 결정적 공정 매개변수(critical process parameters, CPPs — 온도나 공급 속도처럼 운영자가 설정하는 손잡이)와 18개의 결정적 품질 속성(critical quality attributes, CQAs)을 가진 5 L에서의 48개 실험을 다루며, 블랙박스 모델 대비 대략 절반의 데이터로 약 33% 더 나은 예측 정확도를 헤드라인으로 내세웁니다 [2]. 벤더 자신의 페이지는 더 큰 "22% / 3배" 틀을 인용합니다. 동료심사 숫자를 선호하고, "예측 정확도"가 "수율"이 아니며 폐루프 제어가 아님을 유의하며, 성숙도가 GMP 상용이 아니라 공정-개발 (파일럿) 임을 유의하세요.

YokogawaInsilico Biotechnology — 세 번째 귀속 정정 — 를 소유합니다. Yokogawa는 2021년 11월에 Insilico를 인수했습니다. 그것은 Cytiva가 아니었습니다 [8]. Insilico의 접근은 데이터 주도(기계학습) 모델에 결합된 대사 네트워크 모델 — 소프트 센싱(값싼 가용 신호로부터 측정하기 어려운 양을 추정)과 모델-예측 제어(공정의 가까운 미래를 시뮬레이션하여 공정을 조종)를 위한 하이브리드 디지털 트윈(실제 공정과 나란히 돌아가는 살아 있는 소프트웨어 모델) — 이며, (상용/파일럿) 에 자리합니다. (완전한 유전체 규모 대사 모델은 실시간 트윈 안에서 직접 돌아가는 일이 드뭅니다. 배포된 형태는 물리를 라인 속도에서 다루기 쉽게 유지하는 축소된 하이브리드입니다.) 슬라이드 위의 회사 이름을 뒤집기에 똑바로 챙겨야 할 두 가지 통합 사실은 거의 기억술입니다. GoSilico는 Cytiva로 갔고, Insilico는 Yokogawa로 갔습니다 — 비슷한 이름, 다른 인수자, 다른 모델 부류(기계론 대 하이브리드). 둘 중 하나를 바꿔치기한 슬라이드는 단 한 단어로 제품의 소유자, 기술 부류, 그리고 규제 태도를 잘못 진술한 것입니다.

GxP-AI SaaS와 데이터-계층 주자들

더 새로운 무리가 AI를 규제되는 서비스로서, 개조한 것이 아니라 처음부터 GxP(의약품이 만들어지는 방식을 규율하는 "우수 규범(Good Practice)" 규정 군 — 주로 GMP)용으로 지어 팝니다 — 그리고 평행한 무리가 어떤 AI든 작동하기 전에 필요로 하는 데이터 배관을 팝니다.

Aizon은 첫 번째의 가장 명확한 예입니다. 대표작이 다중 사이트 Grifols 배포인 (상용) GxP AI SaaS(Execute, Unify, Predict, 더하기 "Agentic Studio")입니다. Aizon은 또한 검증 질문 자체에 관한 진정한 자체 저자 동료심사 닻을 가진 드문 벤더입니다 — 규제 제조를 위해 AI 알고리즘을 자격검증하는(Isolation Forest로 시연된) PDA Journal of Pharmaceutical Science and Technology 연구는 제품 페이지의 시장에서 주목할 동료심사 예외입니다 [9]. 그 논문은 어떤 결과 백분율보다 구매자에게 더 가치 있는데, 어떻게 검증하는지를 논하기 때문이며, 그것이 시장의 나머지가 손사래 치는 부분입니다. 그 고객-결과 숫자(일반적인 "약 30% 편차 감소")는 대조적으로 벤더 자체보고 마케팅이며, 그 "Agentic AI"는 2026년 초로 사전 발표 되었습니다 — 시연이 아니라 발표이며, 그것이 바로 이 장이 다루는 간극입니다. Aizon은 무리의 규칙을 가장 잘 보여 줍니다. 그것을, 진짜이고 심사된 검증 과학으로 판단하지, 보도자료인 에이전트 로드맵으로 판단하지 마세요.

TetraScience(Tetra OS / Tetra AI)와 Ganymede(Lab-as-Code, 이후 Apprentice.io에 흡수됨)는 모델 자체가 아니라 AI가 필요로 하는 데이터 계층을 팝니다 — 사일로화된 실험실 및 공정 데이터를 FAIR(찾을 수 있고, 접근 가능하며, 상호운용 가능하고, 재사용 가능한, Findable, Accessible, Interoperable, Reusable)하고 질의 가능한 형태로 "AI-준비된(AI-ready)" 재플랫폼화하는 것입니다. 이것이 중요한 이유는 데이터-연료 장(data-the-fuel chapter)이 논했듯, 데이터 준비성이 알고리즘이 아니라 이 분야의 최우선 장벽이기 때문입니다. 비조화된 데이터 위의 완벽한 모델은 깨끗하고 계보가 추적되는 데이터 위의 평범한 모델보다 가치가 덜합니다. TetraScience는 벤더 자체보고 배포 수치(상위 25개 제약 중 열두 곳을 주장; Takeda, Bayer 등이 명명됨)와 결과 수치(QC 회전 시간 "몇 주에서 며칠로")를 가진 (상용) 이고, Ganymede는 흡수 시점에 일반 출시 전 단계인 (파일럿) 입니다. 이 제품들은 진짜 인프라이며, 많은 공장에서 가장 영리한 단기 AI 자금은 더 화려한 모델이 아니라 여기로 갑니다 — 그러나 헤드라인 숫자는 여전히 마케팅이고, "AI-준비됨"은 결과가 아니라 준비성 주장입니다.

"AI-준비됨"이 실제로 무엇을 요구하는지는 시장 전체에서 가장 덜 명세된 어구이며, 그것을 정확히 읽는 것이 구매자가 진짜 데이터 계층을 새 라벨이 붙은 깔끔한 데이터베이스로부터 가르는 법입니다. 실질적 형태는 시맨틱 상호운용성(semantic interoperability)(서로 다른 시스템이 파일 형식만이 아니라 값이 무엇을 의미하는지에 합의하는 것)이며, 데이터 관리 책(data-management book)이 보이듯 그것은 벤더에게 이름으로 물을 수 있는 표준 위에 놓입니다. ISA-95("배치", "단위", "물질 로트"가 무엇인지를 고정하는 장비-그리고-물질 계층), OPC UA(맨 부동소수가 아니라 타입이 있고 모델링된 값을 공장 현장에서 실어 나르는 현대 산업 프로토콜), 그리고 B2MML(MES와 ERP 사이에서 배치 기록을 옮기는 XML 스키마)입니다. 히스토리언 판독값을 BR101.Temp.PV = 36.5로만 안착시키는 데이터 계층은 구문적 작업을 한 것이고, 그것을 섭씨 도(degree)의 타입 있는 온도로, BATCH-2026-001의 생산 단계 위에서, 정상 운영 범위에 비추어 안착시키는 데이터 계층은 ML 특징이 실제로 의존하는 시맨틱 작업을 한 것입니다. "데이터 계층" 벤더에게 그 둘 중 무엇을 전달하느냐고 물으면, 그 답이 질의 가능한 창고를 진정으로 모델-준비된 데이터로부터 가릅니다.

그 위의 다음 단 — 그리고 더 시끄러운 "AI-네이티브" 피치가 약속하지 않으면서 가리키는 것 — 은 온톨로지 / 지식 그래프(ontology / knowledge graph) 입니다. 타입 있는 노드와 명명된 엣지의 그물로, 온톨로지 책(ontology book)이 같은 mAb 캠페인에 대해 짓는 방식으로 OWL/RDF 모델이 지배합니다. 구매자가 붙잡아야 할 구분은 그 장이 긋는 것입니다. 벤더의 "AI-네이티브 스키마, 분류, 또는 온톨로지"는 넓은 엄밀성 범위에 걸칩니다 — 공개 상위-수준 용어를 재사용하는 BFO-접지 OWL 모델에서부터, 마케팅 단어가 공유된다는 이유로 온톨로지라 불리는 열 이름에 대한 사적 합의까지. 진짜 시맨틱 계층이 ML 프로그램에 사 주는 세 가지는 슬라이드웨어가 아니라 검증할 수 있을 만큼 구체적입니다. 첫째, 시맨틱하게-접지된 특징(semantically-grounded features): "단량체 순도"를 취약한 열 이름이 아니라 그 온톨로지 IRI(bp:monomerPct)로 당기는 모델은 소스 시스템이 태그 이름을 바꿔도 조용히 깨지지 않습니다 — 식별자-그리고-단위 규율(identifiers-and-units discipline)이 한 로트를 네 가지로 명명하는 네 시스템 전반에서 특징을 이식 가능하게 만드는 것입니다. 둘째, SHACL-검증된 훈련 데이터(SHACL-validated training data): 비순응 로트를 거부하는 바로 그 폐세계 출하-게이트 형상(release-gate shape)이 비순응 훈련 행도 거부하여, 모든 요구된 CQA가 특징이 되기 전에 존재하고, 단일하며, 타입이 있고, 범위 안임을 증명합니다 — HMW 결과가 조용히 끝내 적재되지 않은 로트를 건네받은 모델은 그 구멍을 메워 채워 넣고 확신에 찬 틀린 숫자를 보고할 텐데, 그것이 바로 SHACL이 금지하려 존재하는 실패입니다. 셋째, 그룹화 키로서의 계보(lineage as the grouping key): 그래프가 bp:derivedFrom 엣지를 기록하므로, 모델은 무작위가 아니라 배치별로 그룹화된 배치-하나-제외(leave-one-batch-out) 교차검증으로 분할될 수 있습니다 — 리콜을 범위 짓는 계보가, 공짜로, 학습 곡선을 정직하게 유지하는 스키마이며, 온톨로지-그리고-AI 장(ontologies-and-AI chapter)이 상술합니다. 이것 중 어느 것도 가설이 아닙니다. 동반 온톨로지 책이 통과 시험으로 돌리는 바로 그 기계이며, "데이터 계층" 판매 주장 아래의 실체입니다. 그래프는 또한 GraphRAG 코파일럿 — 훈련 기억이 아니라 검색된 타입 있는 사실에 접지된 언어 모델 — 이 계보 질문을 유창하게 지어내는 대신 진실되게 답하기 위해 딛고 서야 할 것이기도 합니다. 그래서 벤더가 "온톨로지"라고 말할 때, 구매자의 수는 그 장의 수입니다. 그것이 형식적이고 재사용 가능한 OWL 모델인지 아니면 단어를 두른 사적 스키마인지를 물으세요. 첫 번째만이 모델을 신뢰할 만하게 만드는 시맨틱 특징, 형상-검증된 데이터, 그리고 계보-그룹화된 분할을 전달하기 때문입니다.

자동화 및 MES 기성 기업들: ML이 위에 얹힘, 네이티브가 아님

공장에서 가장 큰 설치 기반은 수십 년간 거기 있어 온 회사들의 것이며, 그들의 AI 이야기는 거의 항상 기존 제어 또는 실행 등뼈에 추가된 층입니다 — 그것은 강점(데이터와 GMP 규율이 이미 사는 곳)이면서 동시에 한계(ML이 제품의 핵심인 경우가 드물고, 분석 로드맵이 누군가 그 플랫폼을 산 이유인 경우가 드뭄)입니다.

Korber(Werum PAS-X MES)는 정전적(canonical) 사례입니다. 상업적 바이오 제조에서 명백히 (상용) 인 예외-검토(review-by-exception — 검토자가 모든 일상 기록이 아니라 편차를 표시하는 기록만 들여다보는) 실행 계층으로, 그 위에 이제 ML과 "Agentic AI"(K.AI, B.R.A.I.N.)가 얹히고 있습니다. PAS-X의 "최대 98% 일발 성공(right first time)"과 예외-검토 표현은 벤더 페이지의 정확한 인용이며 — 그것은 벤더 자체보고 로, "최대 98%"는 전형적 결과가 아니라 최선의 경우 천장이고, "일발 성공"은 어떤 AI가 아니라 전자 배치 기록(electronic-batch-record, eBR — 배치가 어떻게 만들어졌는지의 디지털 기록) 워크플로의 속성입니다. 설치 기반 수치(1000개 이상 설치, 상위 20개 바이오테크의 큰 비중)는 진짜 Korber 주장이지만 서로 다른 페이지에 나타나며, 단일한 부풀린 인상으로 합쳐지기 쉽습니다 [10]. 정직한 독해는 PAS-X가 MES로서 상용급이고 — "일발 성공" 승리는 대부분 어떤 모델이 아니라 구조화된 eBR의 규율 — 그 위의 ML과 에이전트 기능은 초기라는 것입니다.

Siemens(PAT를 위한 PCS 7/neo와 SIPAT, MES를 위한 Opcenter, 모델링을 위한 gPROMS), Rockwell(FactoryTalk PharmaSuite), Emerson(Syncade를 동반한 DeltaV, 더하기 AspenTech 분석), 그리고 AVEVA(PI 데이터 인프라와 예측 분석)가 자동화 기성 기업들을 채웁니다. 모두 제어, 히스토리언(historian), 그리고 실행 플랫폼으로서 (상용) 입니다 — AVEVA의 PI System은 데이터 관리 책(data-management book)이 그 데이터 그림자(data shadow)를 세우는 바로 그 히스토리언(historian — 모든 공장 센서 판독값을 기록하는 시계열 데이터베이스)이며, 그것이 바로 핵심입니다. 이 회사들은 데이터 출처를 소유하는데, 분야의 구속적 제약이 데이터 준비성일 때 그것은 진짜이고 지속적인 이점입니다. 모두 또한 더 얇고 더 (파일럿) 또는 야심적인 ML 이야기를 덧붙였습니다. PharmaSuite의 Rockwell ML은 무리 중 가장 얇고, Siemens(SIPAT 플러스 gPROMS 기계론적 모델링)와 Emerson(AspenTech 분석 플러스 DeltaV PredictPro)이 가장 신뢰할 만한 분석 계층을 가지며, Siemens는 ML이 아니라 기계론적 모델링(gPROMS)을 파는 것이 주목할 만합니다 — 슬라이드 위의 "모델"이 "기계학습"을 뜻하지 않는 또 하나의 경우입니다. 이 패턴은 등급 전반에 유지됩니다. 등뼈는 진짜이고 검증되었으며, 그 위의 지능은 얹히는 중이고, 구매자는 브로슈어가 아니라 등뼈에 값을 매겨야 합니다.

소모품, CDS, 그리고 검증 스택

세 개의 무리가 더 지도를 완성하며, 각각이 공장의 다른 구석에서 이 장의 중심 교훈 — 상용급 핵심, 마케팅급 AI 계층 — 을 반복합니다.

소모품-그리고-지능 회사들은 하드웨어와 나란히 제조 지능을 팝니다. MilliporeSigma/Merck KGaABioContinuumBio4C ProcessPad — 대부분 다변량 및 통계 방법 위에 세워진, 브랜딩 아래 진정한 심층학습 내용은 제한적인 (상용) 제조-지능 및 CPV 플랫폼 — 을 제공합니다. 슬라이드 위의 "Bio4C"는 실제로는 신경망이 아니라 제품화된 MVDA와 CPV입니다. Thermo Fisher는 제품이라기보다 생태계입니다. OSDPredict 플러스 OpenAI, NVIDIA, TetraScience 파트너십의 그물로, 대부분 (파일럿) / 발표 단계입니다 — 파트너 로고의 포트폴리오는 배포된 모델이 아니며, 전달이 아니라 방향으로 읽혀야 합니다.

크로마토그래피-데이터-시스템과 QC 구석은 지배적 CDS인 Waters Empower의 것으로, 그것의 결정론적 ApexTrack 피크 적분 위에 ML 향이 나는 이상 탐지를 더했습니다 — CDS로서 (상용) 이고, ML은 재발명이 아니라 부가 기능입니다. 결정론적 적분기가 QC 실험실이 검증하고 신뢰하는 것이며, 이상 탐지는 편의 계층이고, 둘을 혼동하면 실험실이 출하 결과를 위해 실제로 의지하는 것을 잘못 진술하게 됩니다. 피크 적분 자체가 검증되고 잠긴 분석법의 일부입니다 — 그 매개변수는 방법에 고정되고 시스템 적합성(system suitability)으로 단속되며, 수동 재적분은 빈번한 OOS(규격 이탈 결과, out-of-specification result)이자 데이터 무결성 지적 사항입니다 — 바로 그렇기에 보고 가능한 결과(판매를 위해 로트가 통과해야 하는 크기-배제-크로마토그래피 단량체 백분율 — 온전하고 응집되지 않은 항체의 비율)는 결정론적 적분기에서 나와야 하고 ML 이상 계층은 자문에 머물러야 합니다. 둘을 혼동하면 학습 모델을 출하 결정의 데이터 무결성 경로에 두게 됩니다.

검증 및 규제-콘텐츠 스택은 AI가 서류작업을 만나는 곳입니다. ValGenesis(VLMS 검증 생애주기 관리, 더하기 "Smart GxP" / VAL AI 플랫폼)는 디지털 검증에 (상용) 이며, 그 "80% 더 빠름" 수치는 벤더 자체보고 입니다 — 그리고 위의 분모 시험에 따르면, 정의되지 않은 종이 기반 베이스라인보다 더 빠른 것입니다 [11]. Veeva(Vault Quality/QMS, 2026 로드맵에 품질 AI 에이전트)는 규제 콘텐츠 관리에 (상용) 이고 그 AI 에이전트에 (파일럿) 입니다. 이 스택은 가장 중대한 단기 AI가 실제로 안착하는 곳이며 — GxP 문서의 작성, 검토, 변경 관리 — 또한 규제 당국이 첫 번째 단단한 선을 그은 곳이기도 한데, 다음 절이 설명합니다. 두 사실을 동시에 붙잡을 가치가 있습니다. 문서-작성 사용 사례는 바이오 제조에서 진정으로 가장 가치 있는 단기 AI이며, 그리고 그것은 FDA가 인간 검토 없이 했다고 이미 한 회사를 지적한 바로 그 사용 사례입니다.

히어로 도해: 바이오 제조 ML/AI 벤더 지형의 두-축 지도. 수평 축은 왼쪽의 연구에서 파일럿을 거쳐 오른쪽의 상용으로 흐르고; 수직 축은 위에서 아래로 쌓인 제품 범주 띠다: MVDA/PAT 감시, 기계론 및 하이브리드 모델링, GxP-AI SaaS와 데이터 계층, MES와 자동화 등뼈, 그리고 검증 및 품질 스택. 각 벤더는 자신의 정직한 성숙도로 놓인 라벨 붙은 알약이다: Sartorius SIMCA, AspenTech ProMV와 Emerson은 MVDA 띠의 녹색 상용 구역 맨 오른쪽에 자리하고; Cytiva GoSilico(기계론적, ML 아님으로 표시)와 Yokogawa 소유 Insilico는 하이브리드 띠에서 상용-대-파일럿에 자리하며, 독립 DataHow는 파일럿에 놓이고 Sartorius 아님으로 명시적으로 태깅되며; Aizon과 TetraScience는 SaaS 띠에서 벤더-자체보고 배지와 함께 상용에 자리하고, Ganymede는 파일럿에; Korber PAS-X, Siemens, Rockwell, Emerson과 AVEVA는 MES 띠에서 각각 녹색 상용 성숙도 칩을 달고 있고, 그 얇은 ML 계층은 별도의 점선 파일럿 부가물로 보이며; MilliporeSigma Bio4C, Waters Empower, ValGenesis와 Veeva는 검증 및 품질 띠에서 각각 상용 칩을 달고, Thermo Fisher는 호박색 파일럿 칩을 단다. 에이전트 최전선이라 라벨 붙은 수직 점선이 왼쪽의 시연된 상용을 오른쪽의 발표되었으나 시연되지-않은 에이전트 마케팅으로부터 가르며, 대부분의 에이전트 제공물이 그 선의 오른쪽으로 넘어가는 빈 알약으로 보인다. 마케팅이 아니라 정직한 성숙도로 본 벤더 지도: 다변량 감시, 기계론 및 하이브리드 모델링, 그리고 컴퓨터 비전의 상용급 핵심에, 에이전트-AI 제공물들이 점선 최전선을 넘어 발표되었으나 일상적 GMP에서는 아직 시연되지 않은 영토로 넘어가는 빈 알약으로 그려져 있다. 저자가 AI의 도움을 받아 직접 제작한 그림입니다.

에이전트 마케팅 대 시연된 상용

2026년 시장을 정의하는 긴장은 에이전트(agentic) 라는 단어입니다. Aizon의 Agentic Studio, Korber의 K.AI와 B.R.A.I.N., Veeva의 품질 에이전트, Ganymede/Apprentice의 과학 에이전트 — 거의 모든 벤더가 이제 자율-AI 이야기를 팝니다. ISPE 설문, BioPhorum 성숙도 모델(BioPhorum은 바이오제약 산업 협력체로, 그 모델은 도입 기업이 얼마나 진척했는지를 평가합니다), 그리고 규제 기록 전반에 걸쳐 일관된 현실은 시연된 상용 AI가 네 개의 좁은 곳에 모인다는 것입니다. 다변량 감시, 예측 정비, 컴퓨터 비전 검사, 그리고 인간-개입 문서화. 결정적 품질 속성의 자율 제어는 그 목록에 없으며, 감독되지 않는 에이전트가 GMP 기록을 생성하는 것도 없습니다 [3]. 내면화할 비대칭은 그 네 가지 상용 용도가 에이전트 피치에 없는 속성을 공유한다는 것입니다. 인간이 의사결정자로 남아 있습니다. MVDA는 표시하고 인간이 조사하며; 비전은 기각하고 인간이 처분하며; LLM은 초안 잡고 품질 부서가 승인합니다. 벤더의 이야기가 결정적 결정에서 그 인간을 제거하는 순간, 그것은 시연된 구역에서 마케팅된 구역으로 건너간 것입니다.

두 개의 닻이 그 구분을 단순한 의견 이상으로 지킵니다. 첫째, 초안 Annex 22(EU/PIC/S 공동 협의, 2025년 7월에서 10월) — 첫 번째 제조-특정 AI 규칙 — 가 규제에서 선을 긋습니다. 결정적 GMP 응용에 대해 그것은 정적이고 결정론적인 모델(검증 후 동결되어, 같은 입력에 대해 매번 같은 출력을 주는)만 허용하고 동적이고 연속 학습하며 확률적이고 생성적인 AI/LLM 모델(계속 변하거나, 변동하는 출력을 주는)을 결정적 용도에서 배제하며, 사전 결정된 변경 관리 계획과 인간 감독을 가진 잠긴 모델을 요구합니다 [12]. 벤더 지도에 비추어 읽으면, 그 한 문장이 마케팅을 재분류합니다. 연속 학습하는 "자기-개선" 모델과 생성형-AI 기록 작성자는, 초안 자신의 표현으로, 그 가치가 피치되는 결정적 결정에서 금지되며, 비결정적이고 인간이 감독하는 용도에 갇힙니다. 그것은 초안이고, 2026년 중반쯤 최종화될 것으로 예상됩니다. 그 배제는 잠정적입니다 — 그러나 그것은 구매자에게 어떤 "에이전트" 주장이 오늘날 결정적 결정에 법적으로 손댈 수 없는지, 그리고 왜 상용 핵심이 압도적으로 정적-결정론적 MVDA와 잠긴 비전 모델인지를 정확히 말해 줍니다. 둘째, Purolea cGMP 경고 서한(2026년 4월 2일) — FDA 최초의 AI-인용 경고 서한 — 이 그 간극을 구체적 집행으로 바꿨습니다. 한 회사가 AI 에이전트를 써서 약품 사양, SOP, 그리고 마스터 생산 기록을 적절한 품질 부서 검토 없이 생성했고, 에이전트들이 공정 검증 요건을 누락했으며, 품질 부서가 그 누락을 잡지 못했고, FDA가 21 CFR 211.22(c) — 생산 기록 승인의 책임을 품질 부서에 지우는 규칙 — 아래에서 그것을 지적했습니다 [13][14]. 벤더 슬라이드를 읽는 교훈은 직설적입니다. GMP 기록을 자율적으로 작성하겠다고 약속하는 "에이전트" 플랫폼은 규제 당국이 이미 비준수라고 명명한 무언가를 파는 것입니다. 초안 잡고 인간이 승인하는 에이전트는 제품입니다. 결정하는 에이전트는 책임 부담(liability)입니다.

그 두 집행 닻 너머에는 FDA의 더 넓은 위험 렌즈가 자리합니다. FDA 태도의 정직한 종합은 CDER(FDA의 의약품 평가 연구 센터, Center for Drug Evaluation and Research)의 FRAME 이니셔티브 아래 2023년 논의 문서 Artificial Intelligence in Drug Manufacturing 과, AI 모델 신뢰성을 위한 2025년 1월 초안 틀입니다 [15][16]. 둘 다 위험 기반의 일곱-단계 "사용 맥락(context of use)" 접근을 공유합니다. 요구되는 검토가 모델이 결정에 얼마나 영향을 주고 그 결과가 얼마나 심각한지에 따라 비례합니다. 구매자는 같은 위험 렌즈를 벤더에 쓸 수 있습니다. 제품이 결정적 결정에 더 많이 손댈수록, 그것은 잠긴 모델, 검증 증거, 그리고 루프 안의 인간을 더 많이 보여야 하며 — 보도자료가 그중 어느 것이든 대체하도록 더 적게 허용되어야 합니다. 그 렌즈는 지도 전반에서 양방향으로 자릅니다 — 왜 MVDA 감시(높은 영향력이지만, 인정된 경로를 가진 검사 가능한 정적 모델)는 상용으로 출하되고, 자율 CQA 제어(높은 영향력, 불투명한 동적 모델, 심각한 결과)는 그렇지 않은지를 설명합니다.

# examples/platform/ml/run_suite.py (illustrative wrapper over the Book-5 suite;
# the real, committed harness is examples/platform/ml/run_all.py)
# The open-source counterpoint: every capability the vendors sell, runnable from
# the committed datasets, with no license and no service. Each row maps a market
# category to the suite module that implements its core method in the open.
from importlib import import_module

CAPABILITY_MAP = {
# market category (what the vendors sell) -> open suite module + method
"MVDA / golden-batch monitoring (SIMCA, ProMV)": ("mspc", "PCA + T2/SPE, contribution plots"),
"Raman soft sensing (SIMCA, BioPAT, Insilico)": ("soft_sensor_pls", "PLS + VIP + AD gate (within-batch interpolation; cross-batch split lives in transfer/drift)"),
"deep soft sensing (research-tier)": ("soft_sensor_deep","1D-CNN, beaten by PLS in small data"),
"hybrid digital twin (DataHow, Insilico)": ("hybrid_model", "IVCD x qP backbone + NN residual"),
"computer-vision AVI (Stevanato, Syntegon)": ("vision_avi", "CNN reject classifier on fill events"),
"predictive maintenance (Korber, Siemens)": ("pdm", "anomaly score on equipment signals"),
"release / OOS prediction (Bio4C, iCPV)": ("release_predict", "logistic classifier, nested 5x5 CV over a 120-batch cohort"),
"drift / MLOps (the validation gap)": ("drift", "PSI + residual drift on the soft sensor"),
}

def survey():
print(f"{'market category':48s} module open method")
print("-" * 96)
for category, (module, method) in CAPABILITY_MAP.items():
import_module(module) # each module imports + runs standalone
print(f"{category:48s} {module:18s} {method}")
print(f"\n{len(CAPABILITY_MAP)} vendor categories shown here map onto open modules; "
f"the full run_all.py harness gates 21 of the suite's 33 model modules, 0 licenses, 0 services.")

if __name__ == "__main__":
survey()
market category module open method
------------------------------------------------------------------------------------------------
MVDA / golden-batch monitoring (SIMCA, ProMV) mspc PCA + T2/SPE, contribution plots
Raman soft sensing (SIMCA, BioPAT, Insilico) soft_sensor_pls PLS + VIP + AD gate (within-batch interpolation; cross-batch split lives in transfer/drift)
deep soft sensing (research-tier) soft_sensor_deep 1D-CNN, beaten by PLS in small data
hybrid digital twin (DataHow, Insilico) hybrid_model IVCD x qP backbone + NN residual
computer-vision AVI (Stevanato, Syntegon) vision_avi CNN reject classifier on fill events
predictive maintenance (Korber, Siemens) pdm anomaly score on equipment signals
release / OOS prediction (Bio4C, iCPV) release_predict logistic classifier, nested 5x5 CV over a 120-batch cohort
drift / MLOps (the validation gap) drift PSI + residual drift on the soft sensor

8 vendor categories shown here map onto open modules; the full run_all.py harness gates 21 of the suite's 33 model modules, 0 licenses, 0 services.

그 표 안의 분할-인식(split-aware) 주석들은 앞 장들이 세운 검증 규율입니다. VIP(투영-변수-중요도, variable-importance-in-projection)는 PLS 모델이 어느 입력에 기대는지를 순위 매기고, AD(적용-영역, applicability-domain) 게이트는 훈련 외피 밖에 떨어지는 표본을 채점하기를 거부하며, 배치-내(within-batch) 대 배치-간(cross-batch) 분할은 그러지 않으면 소프트 센서를 부풀릴 데이터 누설을 막고, 중첩 5x5 교차검증(cross-validation, CV)은 모델 선택이 테스트 폴드를 엿보지 못하게 합니다 — 모두 모델-그리고-검증 장(models-and-validation chapter)에 정의되어 있습니다. 표 푸터의 세 수치는 서로 모순되지 않습니다. 위의 여덟 개 능력-지도 행은 run_all.py가 게이트하는 21개 모델 모듈의 선별된 부분집합이며, 그 모듈들은 다시 모음의 총 33개 모듈의 실행 가능한 부분집합입니다.

이 매핑의 핵심은 오픈 모음이 검증된 상업적 플랫폼을 대체한다는 것이 아닙니다 — MLOps 장(MLOps chapter)과 이 책의 모든 거버넌스 절이 고집하듯, 단연코 그러지 않습니다. 핵심은 벤더가 파는 방법들이 거의 모든 경우에 열려 있고 재현 가능하다는 것입니다. PCA, PLS, 그래디언트 부스팅 트리, 작은 CNN, 기계론-플러스-잔차 하이브리드. 진짜 하니스 examples/platform/ml/run_all.py가 더 깊은 핵심을 짚습니다. 그것은 모음의 33개 모듈 중 21개를 하위 프로세스로 돌리고, 각 모듈의 스크립트-끝 assert가 그 합격 기준에서 유지되었는지 포착하며, 어느 모델이 어느 SHA-256-고정 데이터셋 위에서 어느 사전 진술된 게이트를 통과했는지의 단일 원장을 내보냅니다 — 검증 프로토콜의 합격 기준과 검증-시-동결 데이터 고정의 스크립트-수준 유사물입니다. 커밋된 실행은 21/21 models cleared their acceptance gate on the pinned datasets를 보고하며, 검증 불가능한 어떤 벤더 헤드라인에든 맞서는 구체적이고 다시 돌릴 수 있는 반례입니다. 그 게이트된 모듈 중 하나인 batch_mvda.py는 AspenTech ProMV의 황금-배치 감시(DTW-정렬 궤적, 배치별 펼침(unfold), 그다음 MPCA)의 오픈 유사물이며, ProMV 자신의 "황금 배치의 오류" 비판을 구체화합니다. 온라인 황금-배치 MSPC는 펼침 전에 궤적 정렬이 필요한데, 어긋난 궤적이 전형적인 오경보 원인이기 때문입니다. 벤더에게 사는 것은 보통 비밀 알고리즘이 아닙니다. 그것은 그러지 않으면 공짜로 돌릴 수 있는 방법들을 두른 검증된 래퍼 — IQ/OQ/PQ 패키지(설치, 운영, 성능 자격검증 — 시스템이 명세대로 구축되고, 돌아가고, 수행한다는 문서화된 증명), 감사 추적, 변경 관리, 책임 있는 지원 계약, 사전 결정된 변경 관리 계획을 가진 잠긴 모델 — 입니다. 그것을 아는 것이 공정한 가격을 마케팅 프리미엄으로부터 가르는 법입니다. 당신은 수학이 아니라 래퍼와 책임을 위해 지불하고 있습니다.

벤더 주장 한 건의 해부, 사실 검증된

이 시리즈의 서명은 하나의 기록을 필드 하나하나 풀어내는 것입니다. 여기서 그 기록은 벤더 주장 — 이 시장 전체에서 통화의 단위 — 이며, 그 해부는 슬라이드 항목을 품질 부서가 실제로 의지할 수 있는 무언가로 바꾸는 사실 검증입니다.

해부 도해: 벤더 주장, 사실 검증됨이라 제목 붙은 라벨 신원 카드로, DataHow Bristol Myers Squibb 하이브리드-모델 주장을 풀어낸다. 위에서 아래로 행: 주장자 DataHow(독립 ETH Zurich 스핀오프, Sartorius 소유 아님이라 읽는 정정 플래그와 함께); 고객 Bristol Myers Squibb; 두 경쟁 값을 나란히 보인 대표 수치, 22퍼센트 정확도와 3배 적은 실험이라는 붉은 벤더-페이지 값과, 33퍼센트 정확도와 약 절반의 데이터라는 녹색 동료심사 값, 동료심사 수치를 선호하라를 가리키는 화살표와 함께; 자체 저자 동료심사, Biotechnology Journal 2024, DataHow 플러스 BMS 공저라 읽는 증거-등급 행; 파일럿, 공정-개발 규모 5 L, 12 CPP, 18 CQA, GMP 상용 아님이라 읽는 성숙도 행; 폐루프 제어가 아니라 블랙박스 베이스라인 대비 예측 정확도라고 적는 범위 행; 그리고 진짜 방법, 자체 저자 증거, 파일럿 성숙도, 제품 페이지가 아니라 저널을 인용하라고 읽는 판정 푸터. 벤더 주장 한 건, 완전히 사실 검증됨: 소유권이 정정된 주장자, 벤더-페이지와 동료심사 형태로 둘 다 보인 대표 숫자, 그 숫자가 얼마나 멀리 갈 수 있는지를 묶는 증거 등급과 성숙도 표지, 그리고 마케팅 수치를 방어 가능한 것으로 바꾸는 판정. 저자가 AI의 도움을 받아 직접 제작한 그림입니다.

카드를 위에서 아래로 읽으면 이 장의 방법 전체가 구매자가 만나는 어떤 주장에든 채워 넣을 수 있는 필드로 펼쳐집니다.

  • 주장자(Claimant). 누가 주장하고 있으며, 회사 이름은 제대로 명명되기라도 했는가? 잘못 귀속된 주장의 절반은 틀린 회사 이름으로 시작합니다 — DataHow는 독립이고, GoSilico는 Cytiva이며, Insilico는 Yokogawa — 그래서 맨 첫 필드가 소유권 정정을 지닙니다. 이름이 틀리면, 그 아래 모든 필드도 틀립니다.
  • 고객 / 공정(Customer / process). 누구의 공정이 그 숫자를 냈는가? 고객의 특이하고 기밀인 공정(여기서는 Bristol Myers Squibb)에서 측정된 수치는 데이터 점이지, 업계 상수가 아닙니다. 고객 필드는 "30에서 80퍼센트"가 조용히 "당신 것과 다른 공정에서 30퍼센트"가 되는 곳입니다.
  • 대표 수치(Headline figure). 두 번 보입니다. 벤더-페이지 형태(22% / 3배)와 동료심사 형태(33% / 약 절반의 데이터)로, 그 둘 사이의 간극이 카드에서 단연 가장 실행 가능한 것이기 때문입니다. 매번, 제품 페이지의 것보다 저널의 수치를 선호하세요 [2]. 그리고 항상 분모를 물으세요 — 무슨 베이스라인보다 낫고, 무슨 범위에서인가.
  • 증거 등급(Evidence tier). 여기서는 자체 저자 동료심사: 진짜 저널(Biotechnology Journal, 2024)이지만 DataHow와 BMS가 공저자이므로, 제품 페이지보다 강하고 존재하지 않는 독립 재현보다 약합니다.
  • 성숙도 표지(Maturity marker). 파일럿, 공정-개발 규모(5 L, 12 CPP, 18 CQA)에서 — 명시적으로 GMP 상용이 아님. 그 숫자는 개발 규모에서 진짜이고, 상업 라인에 대해서는 아무 말도 하지 않습니다.
  • 범위(Scope). 가장 흔한 과독해, 차갑게 멈춰짐: 블랙박스 베이스라인 대비 예측-정확도 향상은 수율 향상이 아니고 폐루프 제어가 아닙니다. 모델은 더 잘 예측합니다. 그것이 바이오리액터를 돌리는 것은 아닙니다.
  • 판정(Verdict). 산출물 — 품질 부서가 행동할 수 있는 한 문장으로, 숫자와 그 한계와 출처가 붙은 것: 진짜 방법, 자체 저자 증거, 파일럿 성숙도, 제품 페이지가 아니라 저널을 인용하라.

그 일곱-필드 통과가 시장을 인용하는 것과 시장에 팔리는 것 사이의 차이이며, 그것은 이식 가능합니다. Korber의 "98% 일발 성공"이나 ValGenesis의 "80% 더 빠름"에 채워 넣은 같은 카드가, 같은 세 동작으로 빠진 분모, 최선의 경우 천장, 그리고 자체보고 등급을 드러냅니다. Korber의 "98% 일발 성공"에 카드를 돌리면 빠르게 떨어집니다. 주장자는 맞지만, 헤드라인은 "최대 98%"(전형적 결과가 아니라 최선의 경우 천장)이고, 범위는 어떤 AI가 아니라 eBR 워크플로이며, 등급은 벤더 자체보고 이고, 분모 — 일발 성공이 어떤 이전 비율 대비인가? — 는 부재합니다. 판정, 진짜 MES 속성이 AI 승리로 잘못 라벨된 것.

미해결 과제: 독립 증거가 거의 없다

이 장 전체의 정직한 미해결 문제는 시장이 자기 숙제를 자기가 채점한다는 것입니다. 여기 모든 벤더의 증거 등급을 둘러보면 패턴이 극명합니다. 벤더 자체보고 제품-페이지 수치의 두꺼운 띠, 벤더나 고객이 공저자인 자체 저자 동료심사 논문의 얇은 띠, 그리고 — 상업적 효율 헤드라인에 대해서는 — 본질적으로 독립 동료심사 재현이 전혀 없음. 구매 결정을 이끄는 숫자들(Korber의 98% 일발 성공, DataHow의 80% 적은 실험, ValGenesis의 80% 빠른 검증, Amgen의 95% 자동 출하, Aizon의 30% 적은 편차)은 하나하나가 결과에 이해관계가 있는 당사자에 의해, 자신의 공정에서, 외부 재현 없이 생성된 것입니다 [1][5][10][11][17].

이것은 (대부분) 부정직이 아닙니다. 그것은 구조적입니다. 바이오 제조 공정은 기밀이고 비싸며 특이하므로, 정면 대결 독립 벤치마크 — 컴퓨터 비전이나 자연어 처리에서 주장을 접지시키는, ImageNet과 GLUE가 누구든 리더보드를 다시 돌리게 하는 종류 — 는 진짜 GMP 라인에서 거의 조립 불가능합니다. 데이터는 회사를 떠날 수 없고, 공정은 공유될 수 없으며, 어느 두 세포주도 같지 않습니다. 그 결과 구매자는 문헌을 읽어 "이 30%가 진짜인가?"를 해결할 수 없습니다. 그들은 오직 "이 당사자가 신뢰할 만한가, 이 수치가 자체 저자일지언정 동료심사되었는가, 그리고 성숙도 표지가 내가 필요로 하는 배포와 맞는가?"만 해결할 수 있습니다. 이 분야의 빠진 제도는 바이오공정 모델을 위한 독립적이고 중립적인 벤치마크 — 공유되고 현실적이며 공개된 데이터셋과, 답에 이해관계가 없는 누군가가 어떤 벤더의 방법이든 측정할 수 있는 합의된 채점 프로토콜 — 입니다. 이 책의 오픈 모음은 그 방향으로의 의도적으로 작은 몸짓입니다. 공개 데이터셋, 모듈별 진술된 합격 게이트, 그리고 누구든 다시 돌릴 수 있는 재현 가능한 하니스 — 벤더의 벤치마크가 아니라, 데이터가 공개되도록 허용될 때 방법들이 투명하게 채점될 수 있다는 존재 증명입니다. 진짜 공유 벤치마크가 존재하기 전까지, 구매자가 할 수 있는 가장 엄격한 일은 정확히 위의 해부입니다. 제품 페이지보다 동료심사 수치를 요구하고, 성숙도를 용도에 맞추고, 분모를 묻고, 모든 헤드라인 백분율을 사실이 아니라 가설로 다루는 것.

이 장이 모델 모음에 더하는 것

이것은 개관 장이므로, 새로운 모델링 방법을 기여하지 않습니다. 대신 그것이 지도화하는 독점 시장에 맞서는 오픈소스 반례로 examples/platform/ml/ 모음 전체를 재구성합니다. 위의 예시용 run_suite.py 래퍼가 이 장의 읽기 보조입니다 — 각 벤더 범주(MVDA 감시, 라만 소프트 센싱, 딥 소프트 센싱, 하이브리드 트윈, 비전 AVI, 예측 정비, 출하 예측, 표류/MLOps)를 그 핵심 방법을 구현하는 오픈 모듈(mspc.py, soft_sensor_pls.py, soft_sensor_deep.py, hybrid_model.py, vision_avi.py, pdm.py, release_predict.py, drift.py)에 고정하는 능력 지도입니다 — 그리고 커밋된 run_all.py가 반례를 엄격하게 만드는 산출물로, 모든 모듈을 하위 프로세스로 돌리고, 각각의 assert-부호화된 합격 게이트를 점검하며, SHA-256-고정 증거 원장을 내보냅니다. 모음의 모든 실행 가능 모듈은 책의 나머지가 쓰는 같은 커밋된 데이터셋과 시뮬레이터 기반 코호트를 읽고, 서비스 없이 독립으로 돌며, 벤더 카탈로그 뒤의 방법들이 열려 있음을 — 모듈 하나하나 — 시연합니다. 모음이 의도적으로 제공하지 않는 것, 그리고 벤더가 진정으로 파는 것은 그 방법들을 두른 검증된 GxP 래퍼입니다. 잠긴 모델, IQ/OQ/PQ 패키지, 감사 추적, 사전 결정된 변경 관리 계획, 그리고 책임 있는 지원 계약. 모음은 투명해진 방법이고, 검증된 래퍼는 그 일이며, MLOps 장(MLOps chapter)이 그 일이 명세되는 곳입니다.

왜 중요한가

이 시장을 읽지 못하는 구매자는 마케팅에 과지불하고, 이 모든 것이 작동할지를 실제로 결정하는 지루한 인프라 — 데이터 준비성, 검증, 변경 관리 — 에 과소투자합니다. 이 장의 지도는 세 가지 구체적이고 비싼 실수에 대한 방어입니다. 첫째는 귀속 오류(attribution error) 입니다. GoSilico를 "AI" 아래에 진열하거나(그것은 기계론적), Sartorius에게 DataHow의 하이브리드 모델을 돌리거나(DataHow는 독립), Insilico의 인수자를 틀리게 명명하는 것(Cytiva가 아니라 Yokogawa) — 각각이 만들지-살지 결정을 조용히 왜곡하는데, 기계론적 도구, 하이브리드 모델, 그리고 블랙박스가 서로 다른 검증 의무와 다른 규제 태도를 지니기 때문입니다. 둘째는 등급 혼동(tier confusion) 입니다. 상용급 플랫폼의 마케팅 백분율이 확립된 사실로 행세하도록 허용하는 것 — 그것이 명시된 분모 없이 벤더 자신의 공정에서 나온 자체보고 수치일 때. 셋째는 에이전트 과매수(agentic over-buy) 입니다. 초안 Annex 22가 결정적 용도에서 금지하고 Purolea 경고 서한이 규제 당국이 지적할 것임을 이미 보인 자율-AI 약속에 지불하는 것. 지도를 바로잡으면 지출이 가치를 따릅니다. 상용 증거가 진짜인 입증된 MVDA나 비전 플랫폼, 기술이 진정으로 초기인 정직한 파일럿, 이후 모든 모델이 의존하는 데이터-준비성 계층, 그리고 모델이 결정적 결정에 손대는 모든 곳의 인간-개입 가드레일.

실제 현장에서는

시장은 빠르게 통합되고 있으며, 통합 지도 자체가 구매자의 도구인데, 그것이 계약 위의 이름과 제품 뒤의 지원을 바꾸기 때문입니다. 똑바로 챙길 움직임들: GoSilico는 Cytiva로 갔고(2021); Insilico는 Yokogawa로 갔으며(2021); 908 Devices의 바이오공정 분석 포트폴리오는 Repligen으로 갔고(2025); GanymedeApprentice.io에 접혔으며; EmersonAspenTech를 흡수했습니다(대략 백오십억 달러 규모의 움직임) [6][7][8]. 각 움직임이 일 년 뒤 슬라이드 위의 제품을 재귀속하며, 두 이름-충돌 — GoSilico/Insilico, Cytiva/Yokogawa — 이 조달 문서까지 살아남아 그것을 조용히 오도하는 것들입니다. 그 모든 것 아래의 구조적 간극은 오픈 모음이 예시하려 존재하는 바로 그것입니다. 벤더 플랫폼은 독점이고, 재현 가능한 오픈소스 GMP급 바이오공정 ML 도구는 미성숙한 채로 남아 있으며, 오픈 측은 DeepChem(화학과 생명과학을 위한 오픈소스 심층학습 라이브러리)과 학술 라이브러리가 지배하고 어디에도 중립 벤치마크가 없습니다. 시장 전체에서 가장 강력한 단일 상용 사례 — 심층학습 자동 시각 검사(automated visual inspection)(카메라와 비전 모델이 채워진 각 주사기나 바이알의 입자, 균열, 충전 결함을 점검), Amgen이 주사기와 바이알의 대략 95%를 자동 출하(모델이 인간 재검사 없이 통과시킴)한다고 보고 — 는 자격검증에 수년과 FDA와의 직접 대화가 걸렸고, 그 헤드라인조차 업계 언론(trade-press)이며 벤더 자체보고 입니다 [17]. 그것이 한 문장으로 본 시장입니다. 진정으로 상용급인 승리는 좁고, 힘겹게 얻어졌으며, 과대 선전보다 오래되었습니다. 에이전트 미래는 방향으로는 진짜이고 제품으로는 과대 판매되었습니다. 그리고 구매자의 우위는 그 둘을 가르는 규율입니다.

핵심 용어

  • 증거 등급(evidence tier) — 주장이 어떻게 확립되었는가: 독립 동료심사, 자체 저자 동료심사, 벤더 자체보고, 또는 보도자료 한정. 시장은 뒤의 둘이 지배합니다.
  • 성숙도 표지(maturity marker) — 제품이 실제로 얼마나 멀리 갔는가: GMP/상업의 (상용), 규모에서 시연된 (파일럿), 학술/초기의 (연구). 증거 등급과 독립적입니다.
  • 분모 / 반사실 시험(denominator / counterfactual test) — 모든 헤드라인 숫자가 답해야 할 세 번째 질문: 무슨 베이스라인보다 더 빠르고, 더 적고, 또는 더 나으며, 어떤 범위에서, 누구의 공정에서인가. 명시된 비교 대상이 없는 수치는 결과가 아니라 목표입니다.
  • MVDA / MSPC 기성 기업들(MVDA / MSPC incumbents) — Sartorius SIMCA/Umetrics와 AspenTech ProMV(Emerson): 제품화된 PCA/PLS 감시, 시장의 진정으로 상용급인 핵심 — 그리고 결정하기보다 인간을 위해 표시하기에 에이전트 간극이 없는 부분.
  • 기계론 대 하이브리드 대 ML(Mechanistic vs hybrid vs ML) — GoSilico(Cytiva)는 기계론적(학습이 아니라 물리); DataHow와 Insilico(Yokogawa)는 하이브리드(물리 플러스 학습된 잔차); 순수 ML이 상용에서 가장 드뭅니다. 각 부류가 서로 다른 검증 의무를 지닙니다.
  • 귀속 정정(attribution corrections) — DataHow는 독립(Sartorius 아님); GoSilico는 Cytiva 이고 기계론적; Insilico는 Yokogawa(Cytiva 아님).
  • GxP-AI SaaS / 데이터 계층(GxP-AI SaaS / data layer) — Aizon(규제 AI 서비스, 드문 동료심사 검증 논문과 함께), TetraScience와 Ganymede(이 분야의 최우선 장벽을 다루는 AI-준비 데이터 계층).
  • "AI-준비됨" / 시맨틱 상호운용성("AI-ready" / semantic interoperability) — 데이터-계층 주장의 덜 명세된 핵심: 시스템이 값이 무엇을 의미하는지에 합의하는 것으로, 명명된 표준(ISA-95 계층, OPC UA 타입 있는 값, B2MML 배치 기록) 위에 접지됩니다. 벤더가 어느 쪽을 전달하는지 — 구문적 배관인지 진정으로 시맨틱한 데이터인지 — 물으세요. 특징은 후자에 의존하기 때문입니다.
  • 온톨로지 / 지식 그래프(ML 그라운드 트루스로서)(ontology / knowledge graph) — 타입 있는 노드와 명명된 엣지의 형식적 OWL/RDF 모델로, ML 프로그램에 검증 가능한 세 가지를 사 줍니다: 시맨틱하게-접지된 특징(취약한 열 이름이 아니라 IRI로 당김), SHACL-검증된 훈련 데이터(출하-게이트 형상이 완전성을 증명), 그리고 그룹화 키로서의 계보(bp:derivedFrom이 정직한 배치-하나-제외 분할을 가능케 함). 벤더의 "온톨로지"는 이것일 수도, 단어를 두른 사적 스키마일 수도 있습니다 — 첫 번째만이 이것들을 전달합니다.
  • MES/자동화 등뼈(MES/automation backbone) — Korber PAS-X, Siemens, Rockwell, Emerson, AVEVA: ML이 네이티브가 아니라 위에 얹히는 상용급 실행, 제어, 그리고 히스토리언 플랫폼; 그들은 데이터 출처를 소유하며, 그것이 지속적 이점입니다.
  • 에이전트 최전선(agentic frontier) — 시연된 상용 AI(감시, 정비, 비전, 인간-개입 문서)와 발표되었으나 시연되지-않은 자율 에이전트 사이의 선; 규제에서는 초안 Annex 22가, 집행에서는 Purolea 경고 서한이 그었습니다.
  • 통합 지도(consolidation map) — 누가 누구를 샀는가; 계약 위의 이름을 바꿉니다(다섯 건 전체 목록은 "실제 현장에서는"에 있습니다). 조달 문서까지 살아남아 그것을 오도하는 두 이름-충돌은 GoSilico/Insilico(다른 제품)와 Cytiva/Yokogawa(다른 인수자)입니다.
  • 검증된 래퍼(validated wrapper) — 벤더가 그러지 않으면 열려 있는 방법들을 둘러싸고 파는 IQ/OQ/PQ, 감사 추적, 변경 관리, 그리고 사전 결정된 변경 관리 계획을 가진 잠긴 모델. 프리미엄은 알고리즘이 아니라 래퍼와 책임입니다.

다음 이야기

지도는 누가 무엇을 파는지 말해 줍니다. 그것은 브로슈어 뒤의 명명된 배포가 실제로 버텼는지는 말해 주지 않습니다. 다음 장 사례 연구: 명명된 배포와 그 증거(Case Studies: Named Deployments and Their Evidence)는 특정 회사와 숫자 — Amgen Juncos, DataHow/BMS 하이브리드 모델, WuXi의 자율 실험실, Sanofi의 수율 분석, 시각-검사 배포들 — 를 가져다가 각각을 그 실제 증거에 비추어 채점하며, 이 장이 만든 바로 그 해부를 시장이 자신에 대해 말하는 헤드라인 이야기들에 적용합니다.