규제 시맨틱: IDMP, SPL, KASA, 그리고 구조화된 제출
📍 현재 위치: 제8부 · 오늘날 산업 현장의 온톨로지. 앞선 장들은 형식 온톨로지가 가장 얇게 깔린 제조 현장을 걸었습니다. 이제 우리는 규제 인터페이스로 건너갑니다 — 구조화되고 시맨틱한 데이터가 가장 앞서 있고, 곳에 따라서는 법으로 강제되기까지 한 곳입니다.
이 부의 앞 장들은 불편한 발견 하나를 전했습니다. mAb-A — 이 책이 러닝 예제로 따라가는 단일클론항체 — 가 실제로 만들어지는 GMP(Good Manufacturing Practice, 우수 제조 관리 기준) 제조 현장에서, 사물이 무엇이고 서로 어떻게 관계 맺는지를 기계가 읽을 수 있게 모델링한 온톨로지(ontology)는 드물다는 것입니다. 이를 두고 이 기술에 대한 유죄 판결로 읽을 수도 있겠습니다. 그러나 그것은 잘못된 교훈입니다.
공장에서 규제 당국 쪽으로 경계를 건너가면 그림이 뒤집힙니다. 제조사가 당국에 약이 무엇인지 — 그 물질, 함량, 라벨, 품질 — 를 알리는 그 인터페이스는, 산업 전체에서 시맨틱이 가장 앞선 영역입니다.
그리고 그 상당 부분은 선택지가 아닙니다. 법입니다. 현장의 구조화 데이터가 그렇게 하는 편이 이득이기에 공장이 구축하는 것이라면, 규제 인터페이스의 구조화 데이터는 그것이 없으면 제출 자체가 문턱에서 거부되기에 공장이 구축하는 것입니다.
스택에 들어가기 전 한 가지 틀을 잡아 둡니다. mAb-A는 바이오의약품이므로, 미국에서는 Food, Drug & Cosmetic Act 아래의 신약 신청(New Drug Application)이나 약식 신약 신청(Abbreviated New Drug Application)이 아니라, Public Health Service Act 제351조 아래의 바이오의약품 허가 신청(Biologics License Application, BLA)으로 제출됩니다. 그 구분이 이어지는 많은 것을 조용히 규정합니다. 이 장의 구조화 평가·구조화 CMC 파일럿들은 저분자, 고형 경구, 제네릭 쪽에서 태어났으며, 그래서 액상 단일클론항체 — 이 책이 따라가는 바로 그 제품 — 가 각각에 가장 늦게 도달하는 경향이 있습니다.
이 장은 그 스택을 일별하되, 이 책이 첫 페이지부터 고집해 온 구분을 가지고 그렇게 합니다. 규제 인터페이스는 대부분 구조화된 XML, HL7 FHIR(의료 데이터 교환 형식), 그리고 통제 어휘(controlled vocabulary, 승인된 용어를 모은 공유 공식 사전)로 지어져 있습니다 — 이 책이 지어 온 논리 기반 모델인 형식 OWL 온톨로지가 아닙니다. 그중 정확히 하나만이 — 이미 진술된 사실로부터 새 사실을 추론하는 엔진인 — 추론기(reasoner)를 뒤에 둔 진정한 OWL 온톨로지이고, 나머지는 강제되고 검증된 구조화 데이터입니다.
그런 조합이 실제로 출하된 이유 — 그리고 자기수정형 추론 온톨로지가 그러지 못한 이유 — 를 이해하는 것이 이 장의 진짜 핵심입니다. 그 답은 어떤 빠진 표준에 있는 것이 아니라, 규제 환경에서 무엇이 돌아가도 되는지를 애초에 결정하는 체제 안에 놓여 있는 것으로 드러납니다.
모든 나라가 같은 양식을, 같은 칸에, 같은 공식 단어 사전을 써서 작성하기로 합의했다고 상상해 보십시오. 사람이 읽기도 전에 컴퓨터가 그 양식을 점검할 수 있도록 말입니다. 약품 규제 당국이 제품 정체성과 라벨링에 대해 만들어 놓은 것이 대략 이것입니다 — 공유 양식과 공유 코드북. 그들이 만들지 않은 것은 당신의 제출을 추론해서 다시 써 주는 기계입니다. 양식은 잠겨 있고, 감사되고, 검증됩니다. 그것은 생각하지 않습니다. 점검 가능한 양식 대 생각하는 시스템 — 그 차이가 바로 왜 규제 경계에서 구조화 데이터가 이겼고 살아 있는 온톨로지는 그러지 못했는지에 관한 이야기 전부입니다.
이 장에서 다루는 내용
우리는 법적 구속력이 있는 핵심에서 시작합니다. ISO IDMP(Identification of Medicinal Products, 의약품 식별)와 EMA의 SPOR 마스터 데이터 서비스, 이어서 FDA의 물질 백본인 GSRS/UNII, 그리고 그 라벨링 표준인 SPL입니다.
다음으로 우리는 비임상 데이터 표준 CDISC SEND와 그것의 집행 이빨인 Technical Rejection Criteria(기술적 거부 기준), 그리고 FDA의 내부 구조화 평가 플랫폼 KASA — 이 책의 SHACL 출시 게이트(배치를 출시해도 되는지를 규칙으로 점검해 결정하는 품질 게이트)와 현실에서 가장 가까운 사촌 — 를 만납니다.
거기서부터 우리는 아직 파일럿 중이거나 제안 단계인 것들을 일별합니다. PQ/CMC FHIR, eCTD v4.0(electronic Common Technical Document, 전자 공통 기술 문서 — 제출물이 포장되는 표준 봉투), 그리고 ICH M16 / SPQS에 담긴 구조화 CMC의 미래입니다. 우리는 단 하나의 형식 OWL 산출물인 Pistoia IDMP Ontology를, 그리고 모든 것을 관통하는 단위 문법 UCUM을 짚습니다. 마지막으로 우리는 GxP 검증 게이트(GxP validation gate) — 온톨로지가 현장 밖에 머무는 진짜 이유 — 와 정면으로 마주합니다.
하나의 물질 정체성이 지식 그래프에서 출발해 의무화된 구조화 제출 계층을 — 성숙도별 색으로 — 거쳐 올라가다, GxP 검증 관문이 살아 있는 추론기를 막는 지점에서 멈춘다.
저자가 AI의 도움을 받아 직접 제작한 그림입니다.
강제된 핵심: ISO IDMP와 EMA SPOR
토대는 통칭 ISO IDMP — Identification of Medicinal Products(의약품 식별) — 라 불리는 ISO 표준 군(群)입니다. 물질, 제품, 제형, 단위, 조직을 균일하고 기계가 읽을 수 있는 방식으로 기술하기 위한 데이터 모델의 집합입니다.
유럽연합에서 그 사용은 권고가 아닙니다. ISO IDMP는 Commission Implementing Regulation (EU) No 520/2012 제25–26조에 따라 회원국, 판매허가 보유자, 그리고 EMA에 법적으로 강제됩니다 [1]. 바로 그 단어 — 강제 — 가 이 계층을 책의 거의 모든 다른 것과 구별 짓습니다. 제조사가 IDMP를 채택하는 것은 그것이 우아해서가 아니라, 법이 제출을 구조화하도록 요구하기 때문입니다. (상용 단계)
EMA는 IDMP를 SPOR라는 약어로 알려진 네 개의 마스터 데이터 서비스 — Substances(물질), Products(제품), Organisations(조직), Referentials(참조) — 를 통해 제공합니다. 그중 둘이 먼저 출범해 2017년 6월부터 운영되어 왔습니다. Referentials Management Service(RMS)와 Organisations Management Service(OMS)입니다.
제품 서비스인 PMS는 HL7 FHIR — 이 스택의 나머지가 기대고 있는 바로 그 의료 데이터 교환 표준 — 위에 지어져 있습니다. 그 일정은 뒤죽박죽되기 쉬우므로, 정확하게 진술해 둘 가치가 있습니다.
PMS 제품 사용자 인터페이스는 2024년 5월 31일에 읽기 전용으로 가동을 시작했습니다. PMS API는 지연되어 2024년 7월 3일에 읽기 전용으로 공개되었고 — 이 두 날짜는 흔히 혼동됩니다 — 쓰기·편집 접근은 2024년 말부터 단계적으로 풀렸습니다 [1]. (상용 단계)
이것은 우리의 러닝 예제에서 bp:DS-001 뒤에 놓인 실세계 정체성을 짊어질 계층입니다. IDMP 물질 식별자는, 우리 그래프가 작업 세포은행 WCB-CHO-001(제조 사슬이 시작되는 CHO — Chinese-hamster-ovary, 중국 햄스터 난소 — 생산 세포 바이알)부터 추적하는 바로 그 원료의약품(drug substance)에 대해 규제 당국이 붙이는 이름입니다.
이것은 사실상, 실제 공장이 자기 내부 historian이 아니라 당국에 말을 걸 때 그 노드 뒤에 놓는 것입니다. 내부 bp: 식별자는 공장의 지식 그래프를 위한 것이고, IDMP 식별자는 그 바깥세상을 위한 것입니다. 둘은 같은 물질을 가리키며, 그 대응을 참되게 유지하는 일이 곧 제대로 작동하는 마스터 데이터 규율의 존재 이유 가운데 하나입니다.
존재론적으로 둘은 같은 종류의 것이 아니며, 컴패니언 모델은 그 점에 신중합니다. bp:DS-001은 원료의약품 그 자체 — 독립적 연속체(independent continuant), BFO 물질 개체(그 자체로 존재하는 물리적 사물) — 인 반면, IDMP 정체성 bp:IDMP-DS-001(bp:uniiCode와 bp:mpid를 짊어짐)은 정보 내용 개체(information content entity)(사물 그 자체가 아니라 사물에 관한 정보 한 조각: bp:SubstanceIdentifier rdfs:subClassOf bp:InformationArtifact rdfs:subClassOf iof:InformationContentEntity, BFO 일반 종속 연속체)로서, bp:isAbout — IAO의 is about(obo:IAO_0000136)에 정렬됨 — 을 통해 그 물질에 관한 것입니다. MPID나 UNII가 그것이 지칭하는 물질은 그대로인 채로 재발급되거나 정정될 수 있는 이유가 바로 이것입니다. 당신이 편집하는 것은 라벨이지, 라벨이 붙은 그것이 결코 아닙니다.
컴패니언에서 이 대응은 소망이 아니라 실행 가능한 인수 시험입니다. 역량 질문 CQ-16 — 온톨로지가 답할 수 있어야 하는 평이한 영어 질문 가운데 하나로, 프로젝트의 요구사항 문서(ORSD)에서 끌어온 것 — 은 ORSD 자체의 표현으로 묻습니다 — "ISO IDMP 규제 정체성이 출시 게이트가 검증한 바로 그 노드에 붙는가, 복사본이 아니라?" — 그리고 validate.py는 이를 실행합니다, 한 줄짜리 ASK(참 또는 거짓만 반환하는 SPARQL 질의)로:
PREFIX bp: <https://example.org/bioproc#>
ASK {
bp:DS-001 bp:hasSubstanceIdentifier ?id . # 규제 당국의 IDMP/UNII 정체성
bp:DS-001 bp:monomerPct ?m . # 출시된 CQA 패널
}
이것이 통과하는 것은 오직 IDMP 정체성과 출시 게이트 결과가 같은 bp:DS-001 노드에 매달려 있기 때문이지, 별도의 레코드에 매달려 있어서가 아닙니다. 규제된 정체성과 출시된 품질은 하나의 개체입니다 — 이것이야말로 방금 위에서 이름 붙인 마스터 데이터 규율이며, 그저 단언되는 것이 아니라 초록이거나 빨강인 시험으로 표현된 것입니다.
그리고 이것은 코드로 차려입은 산문이 아닙니다. 같은 ASK가 컴패니언의 실행 가능한 ORSD인 cq-catalog.json 안에 살아 있으며, examples/platform/ontology/validate.py가 평범한 오픈소스 트리플스토어 위에서 그것을 실행합니다 — Book 3가 RDFLib로 짓는 실행 가능한 SPARQL 속성 경로 디지털 스레드 질의, 곧 여기서는 규제 조인을 겨냥한 바로 그 관용구입니다. 따라서 CQ-16의 초록이거나 빨강인 결과는 벤더가 믿어 달라 청하는 주장이 아니라, 노트북에서 재현 가능한 것입니다. 그 점이 규제 경계에서 정확히 중요합니다. 구조화된 제출은 그 일관성 점검을 저자가 아닌 누군가가 다시 실행할 수 있을 때에만 감사 가능하기 때문입니다.
FDA 물질 백본: GSRS와 UNII
이 계층 전체를 떠받치는 구분이 하나 있는데, ISO 번호들이 등장하기 전에 평이하게 이름 붙여 둘 가치가 있습니다. 우리의 러닝 예제가 이미 부호화하고 있는 바로 그 구분이기 때문입니다. IDMP는 물질 — 분자 그 자체, mAb-A — 을, 그 둘레에 지어진 시장성 있는 것, 곧 제품(하나의 함량, 하나의 제형, 하나의 포장)으로부터 분리합니다. 둘은 서로 다른 표준과 서로 다른 식별자를 받는데, 바로 그래서 bp:IDMP-DS-001은 bp:uniiCode(물질 코드)와 bp:mpid, 곧 Medicinal Product Identifier(의약품 제품 식별자)를 함께 짊어집니다 — 같은 규제 정체성의 두 계층에 대한 두 이름입니다.
미국은 물질 정체성을 Global Substance Registration System(GSRS, 전역 물질 등록 시스템)에 정박합니다. FDA와 NIH/NCATS가 공동 개발한 것입니다. GSRS는 IDMP 물질 표준 — ISO 11238(물질 식별)과 그것의 ISO/TS 19844 물질 구성요소 구현 — 을 구현하는데, 이는 EMA의 SPOR 서비스가 제품 쪽에서 구현하는 IDMP 제품 표준(ISO 11615과 11616/11239/11240 군) 옆에 놓입니다. GSRS는 모든 물질을 소수의 물질 클래스 중 하나로 분류하며 — mAb-A 같은 단일클론항체는 단백질(protein)로 등록됩니다 — 그에 대해 무료이고 비독점인 UNII(Unique Ingredient Identifier, 고유 성분 식별자) 코드를 발급합니다. DailyMed에 공개적으로 노출되는 코드입니다. 우리 컴패니언에서 그 UNII는 bp:IDMP-DS-001 위에 bp:uniiCode로 올라타며, 이는 CQ-16이 bp:DS-001에 도로 묶는 바로 그 bp:SubstanceIdentifier 노드입니다.
규모는 실제적입니다. 2020년에 공개된 시스템 릴리스에는 116,636건의 물질 정의가 담겨 있었습니다 [2]. 물질 식별자가 무료이고 비독점이라는 점은 들리는 것보다 더 중요합니다 — 그것은 UNII가 라이선스 마찰 없이 시스템과 조직을 가로질러 이동하게 해 주는 속성이며, 이 책이 전역 IRI를 지식 그래프에 고정할 것을 주장했을 때 내세운 바로 그 속성입니다.
주목할 점은, EU 물질 서비스인 EU-SRS가 같은 GSRS 소프트웨어 위에서 돌아가며 2023년 1월부터 EMA에서 가동되어 왔다는 것입니다 — 사후에 경쟁하던 두 레지스트리를 화해시키는 대신, 두 당국이 하나의 코드베이스를 공유하는 드문 사례입니다 [2]. (상용 단계)
라벨링 표준: SPL
제조사가 제품 라벨을 제출할 때, 그것은 PDF를 제출하는 것이 아닙니다. Structured Product Labeling(SPL, 구조화된 제품 라벨링), 곧 HL7 v3 XML 표준을 제출합니다. SPL은 FDA Amendments Act of 2007과 21 CFR Part 207에 따라 의무입니다.
그리고 그것은 태그로 차려입은 자유 텍스트가 아닙니다. SPL 문서는 NCI Thesaurus에서 가져온 44개의 통제 용어 서브셋에, NDC와 UNII 식별자를 더해 끌어다 씁니다. 그래서 각 필드의 의미는 검토자가 손으로 해석해야 하는 산문에 맡겨지는 대신 공유 어휘에 고정됩니다 [3]. 다시 말해, 라벨은 계산 가능합니다. 모든 제출에서 모든 필드가 같은 것을 지칭하므로, 당국은 라벨들을 가로질러 질의할 수 있습니다. (상용 단계)
비임상 데이터와 그것의 집행 이빨: SEND
비임상 — 즉 동물 — 시험 데이터에 대해, FDA는 CDISC SEND(Standard for Exchange of Nonclinical Data, 비임상 데이터 교환 표준)를 강제합니다. 한 가지는 분명히 진술해야 합니다. 흔하고 결과가 중대한 오해이기 때문입니다. SEND는 비임상 시험 데이터만을 다스립니다. 그것은 제조 표준도 CMC 표준도 아닙니다. BATCH-2026-001이 어떻게 운영되고 시험되었는지에 대해서는 아무 말도 하지 않습니다. 그것의 통제 용어는 NCI Thesaurus를 통해 배포되며, 이는 CDISC Controlled Terminology의 상용 배포 플랫폼입니다.
SEND는 또한 실제 집행의 이빨을 지니고 있습니다. Technical Rejection Criteria(기술적 거부 기준) — 기계가 점검하는 오류 코드의 집합 — 는 2021년 9월 15일부터 발효되었고, 그 이후 비적합 제출은 어떤 인간 검토자가 보기도 전에 문턱에서 기술적으로 거부됩니다 [4]. (상용 단계)
KASA: 규칙 기반 평가이지, 온톨로지가 아니다
이 책의 SHACL 출시 게이트와 규제상 가장 가까운 친척은 KASA — Knowledge-Aided Assessment and Structured Application(지식 보조 평가 및 구조화 신청) — 곧 FDA 의약품품질국(Office of Pharmaceutical Quality)의 내부 검토 플랫폼입니다. 잠시 멈춰 볼 가치가 있습니다. 규제 당국이 상용 환경에서 이 책이 줄곧 모델링해 온 것과 가까운 무언가를 실제로 해내는 곳이기 때문입니다.
2021년 2월 비멸균 고형 경구제 ANDA를 위해 출범한 이 플랫폼은 300명이 넘는 활성 사용자를 보유하며, 2025년의 한 동료 심사 논문은 2024년 9월까지 완료된 1,130건이 넘는 제조 평가를 기록합니다 [5]. KASA는 규칙과 정량적 위험 모델을 표준화된 CMC 데이터에 적용하며, PQ/CMC 구조화 데이터를 소비하도록 설계되어 있습니다.
그러나 그것은 정직하게 분류되어야 합니다. KASA는 구조화 데이터·통제 어휘 플랫폼이지, 추론기를 갖춘 형식 OWL 온톨로지가 아닙니다.
그것은 우리의 SHACL 게이트가 DP-004를 스펙에 비춰 점검하는 방식 — 규칙으로, 형태(shape)에 비춰 — 그대로 구조화된 의미를 점검하지, 지식 그래프(의미로 연결된 사실들의 그물) 위의 추론(데이터가 한 번도 명시적으로 진술하지 않은 새 사실을 도출하는 것)으로 하지는 않습니다. 우리 출시 게이트와의 닮음은 실재하고, 둘 사이의 경계 또한 실재합니다. (상용 단계, 내부용)
파일럿과 제안: 구조화된 제출의 미래
스택의 여러 조각은 실재하지만 아직 의무는 아닙니다. 여기서는 신중할 가치가 있습니다. 공개됨과 수용됨과 요구됨의 차이야말로, 사람들이 규제의 미래를 이미 도착한 것처럼 묘사할 때 사라지는 바로 그 차이이기 때문입니다.
아래 표는 가까운 미래의 이니셔티브들을 성숙도순으로 정렬하며, 각 항목에 붙은 꼬리표는 실제로 일을 합니다 — 공개된 구현 가이드는 의무가 아니고, 수용된 형식은 요구된 형식이 아닙니다.
| 이니셔티브 | 무엇인가 | 상태 |
|---|---|---|
| PQ/CMC FHIR | eCTD Module 3에 XML로 제출되는 FHIR 문서를 프로파일링한 FHIR R5 구현 가이드로, NCIt 용어를 사용 | 공개되어 Connectathon에서 시험됨; Solid Oral Dosage Form(고형 경구제)에 한정(액제와 바이오의약품은 향후 과제); 아직 명시적으로 강제 형식 아님 (파일럿 단계) |
| eCTD v4.0 | HL7 v3 Regulated Product Submissions 메시지 표준 위에 지어진 차세대 제출 봉투 | FDA가 2024년 9월 16일부터 수용 개시(자발적; v3.2.2도 여전히 지원); Japan PMDA는 2026년 4월 1일부터 의무화; EU는 2025년 말경 선택적 가동을 목표로 하고 이후 의무화 예정 (수용된 형식으로서 상용 단계; 미국·EU에서 아직 의무 아님) |
| ICH M4Q(R2) / M16 / SPQS | CTD Module 3을 IDMP에 정렬해 세분화·재구조화한 것으로, 구조화 데이터 계층은 ICH M16 / Structured Product Quality Submissions로 연기됨 | M4Q(R2)는 2025년 Step 2 협의에 도달; 구조화 계층(M16/SPQS)은 연기됨; ICMRA의 PQ Knowledge Management 이니셔티브는 UNII/GSRS와 SPOR 위에 쌓는 공통 식별자를 제안 (제안 단계) |
날짜는 보도 자료가 아니라 달력에 비춰 읽으십시오. eCTD v4.0은 미국에서 수용된 형식이지 요구된 형식이 아니며, v3.2.2도 여전히 지원됩니다. Japan PMDA의 의무화는 2026년 4월 1일에 발효되었고, EU의 선택적 가동은 2025년 말경을 목표로 했으며 구속력 있는 의무화는 아직 뒤따라야 할 일로 남아 있습니다 [6][7][8].
이 행을 묶는 것은, 셋 모두가 그 내용물 위의 추론 계층이 아니라 더 구조화된 제출 봉투와 템플릿 — 문서를 넘겨주는 더 잘 정리된 방식 — 을 기술한다는 점입니다. 제출은 점점 더 데이터베이스를 닮아 가고 있습니다. 그것이 추론하는 모델이 되어 가는 것은 아닙니다.
이 행 전체에 걸쳐, 더 구조화됨은 더 추론함이 아닙니다. PQ/CMC FHIR, eCTD v4.0, ICH M16/SPQS는 모두 제출을 더 데이터베이스답게 만듭니다 — 더 잘 정리된 칸, 공유 코드북, 기계가 점검 가능한 필드. 그중 어느 것도 제출된 사실들로부터 새 사실을 추론하는 계층을 더하지 않습니다. 그것이 이 장의 나머지가 다가서는 경계입니다. 점검 가능한 양식은 생각하는 시스템이 아니며, GxP 게이트가 금하는 것은 오직 두 번째 종류입니다.
단 하나의 형식 온톨로지, 그리고 단위 문법
이 스택 전체에서 정확히 하나의 산출물만이 진정한 OWL 온톨로지입니다. Pistoia IDMP Ontology — 공개되어 있고 MIT 라이선스이며, 열 곳이 넘는 제약사가 채택한 것으로 보고되고, ISO/TS 21405를 통해 표준화되고 있습니다. 엔터프라이즈 지식 그래프 장에서 기술했듯, Johnson & Johnson은 EMA PMS 마감을 맞춰 이 위에 제품 마스터를 구축했습니다.
온톨로지 자체는 산업 전반에 걸쳐 (파일럿 단계)로 분류하는 것이 가장 적절합니다. 그 한 회사의 마스터 데이터가 이 위에 지어져 상용으로 굴러가고 있을 뿐, 고르게 가동되고 있는 것은 아니기 때문입니다 [9]. 그것은 규칙을 증명하는 예외입니다. 규제 스택의 나머지가 구조화 데이터로 손을 뻗는 곳에서, 여기서는 하나의 형식 온톨로지가 제 자리를 벌어들입니다 — 그리고 그조차 현장이 아니라 마스터 데이터 계층에서 그렇게 합니다.
위의 모든 계층을 관통하는 한 가닥이 있습니다. 단위입니다. UCUM — Unified Code for Units of Measure(측정 단위 통합 코드) — 는 HL7과 FHIR에 내장된 단위 표준이며, 따라서 EMA PMS, FDA SPL, PQ/CMC FHIR 안에도 똑같이 들어 있습니다 [10].
이 책의 식별자 장은 지식 그래프에 QUDT를 고정했습니다. 규제 와이어는 UCUM을 씁니다. 따라서 실제 공장은 둘 다를 말해야 합니다 — 자기 그래프 안에서는 QUDT, 당국으로 가는 회선에서는 UCUM — 그리고 그 둘 사이의 매핑을 유지해야 합니다. 단위를 잃거나 잘못된 단위를 짊어진 수량은, 다른 곳의 어떤 구조로도 고칠 수 없는 결함이기 때문입니다.
로딩 가능한 그래프는 이미 단일 값 위에 두 문법을 모두 짊어집니다. OPC UA 와이어에서 들어온 배양 온도 설정점은 한 번 타입이 매겨지고 두 번 라벨이 붙습니다. 지식 그래프를 위한 qudt:hasUnit unit:DEG_C와, 와이어를 위한 qudt:ucumCode "Cel" — QUDT IRI와 UCUM 코드가 같은 섭씨도를 이름 짓습니다. 값 하나하나 그 짝을 유지하는 것이 곧 규제 제출이 의존하는 QUDT-대-UCUM 매핑입니다.
다만 출시 값에 대해서는 정확해야 합니다. 과잉 주장하기 쉽기 때문입니다. 우리 모델에서 bp:BATCH-2026-001 — 우리 러닝 예제가 따라가는 깨끗하게 출시된 원료의약품 배치 — 의 SEC %monomer(크기 배제 크로마토그래피로 측정한, 온전한 단일 항체 분자의 비율) 값 98.611은 완전 한정된 qudt:QuantityValue — qudt:numericValue 98.611, qudt:hasUnit unit:PERCENT, qudt:hasQuantityKind qkind:DimensionlessRatio — 이고, 그 정전(正典) UCUM 코드는 퍼센트 기호입니다. 컴패니언은 그 노드 위에 QUDT 단위 IRI를 찍지, 구체화된 qudt:ucumCode를 찍지 않습니다. UCUM 문자열은 그 값이 규제 제출로 넘어갈 때 다시 표현되는 대상이며, 거기서 PMS와 PQ/CMC FHIR은 QUDT IRI가 아니라 UCUM 코드를 짊어집니다. 숫자는 바뀌지 않습니다. 그것을 감싸는 문법이 바뀔 뿐입니다. 그리고 그 규율은, 또한, 하나의 시험입니다. 역량 질문 CQ-19 — "저장된 모든 수량 값이 단위를, QUDT 단위 IRI 또는 UCUM 코드를, 짊어지는가 — 맨숫자는 없는가?" — 는 0행을 반환해야 하는 위반자 SELECT이며, 그래서 단위를 잃은 수량은 조용한 결함이 아니라 실패하는 빌드입니다. (상용 단계)
미해결 과제: 구조화된 CMC는 여전히 대부분 PDF다
이 모든 진전에도, 진짜로 빠진 조각은 구조화된 CMC 그 자체입니다.
제출의 화학·제조·통제(chemistry, manufacturing, and controls) 내용 — 배치가 실제로 어떻게 만들어지고 시험되는지를 기술하는 부분, 이 책이 모델링해 온 모든 것에 가장 가까운 부분 — 은 여전히 대부분 서술형 PDF입니다. 그것을 대체하기로 되어 있는 구조화 데이터 계층 ICH M16 / SPQS는 제안 단계이지 시행 중이 아닙니다 [8].
"서술형 PDF"가 무엇을 치르게 하는지 보려면, 러닝 예제를 그 도시에(dossier) 위치시켜 보십시오. 우리 그래프가 bp:DS-001에 관해 아는 모든 것 — 그 제조, 특성 규명, 출시 CQA 패널 — 은 실제 BLA에서 CTD(Common Technical Document, 공통 기술 문서) 섹션 3.2.S(Control of Drug Substance, 원료의약품 관리)에 놓이고, 충전된 바이알에 관한 모든 것은 3.2.P(Control of Drug Product, 완제의약품 관리)에 놓입니다. 그리고 "원료의약품 관리"는 추상이 아닙니다. 3.2.S.2는 이 책이 따라가는 바로 그 하류 트레인을 단계별로 서술합니다 — 정화된 수확물에서 mAb-A를 결합·포획하는 Protein A 캡처 컬럼, 응집체와 숙주세포단백질을 걷어내는 저pH 바이러스 불활화 유지 단계와 직교 폴리싱 크로마토그래피, 로그 감소값이 등록된 클레임인 20나노미터 바이러스 여과 단계, 그리고 최종 원료의약품으로 농축·완충액 교환하는 UF/DF입니다. 각 단계의 검증된 운전 범위와 그 불순물 제거 증거 — 우리 SHACL 게이트가 강제하는 응집체, HCP, 2.0 % HMW 출시 한계 — 는 오늘날 3.2.S 산문입니다. 오늘날 그 섹션들은 검토자가 눈으로 읽는 표가 딸린 산문입니다. 구조화 CMC의 미래란, 우리 SHACL 게이트가 패널을 점검하는 그 방식 그대로 3.2.S.4와 3.2.P.5를 기계가 점검할 수 있게 만들자는 제안입니다. 이 책이 모델링한 모든 것에 가장 가까운 부분이 여전히 가장 덜 구조화된 부분이라는 것은 노력의 우연이 아닙니다 — 그것은 현장의 GxP 기록과 제출이 만나는 부분이며, 그래서 검증 게이트가 가장 시샘하듯 지키는 부분입니다.
그리고 그 뒤에 숨은 두 번째, 더 깊은 한계가 있습니다. M16이 안착하더라도, 그것은 살아 있는 추론 온톨로지로 도착하기 훨씬 전에 검증되고 잠긴 구조화 데이터로 도착할 것입니다. 제출 경계는 더 점검 가능해질 것입니다. 그것이 곧 추론기를 갖게 되지는 않을 것입니다. 그 이유가 다음 절의 주제이며, 이 장에서 가장 날카로운 지점입니다.
GxP 게이트: 왜 온톨로지가 현장 밖에 머무는가
여기 솔깃한 오독에 대한 교정이 있습니다. 형식 온톨로지가 생산 현장에 드문 이유는 빠진 어휘나 미성숙한 표준이 아닙니다 — 책의 이 지점에 이르러 우리는 표준이 존재하고, 성숙해 있으며, 와이어 형식의 상당 부분은 무료이기까지 하다는 것을 보았습니다.
그것은 전산 시스템 검증(computerized-systems-validation) 체제입니다. GAMP 5(제2판, 2022년), 21 CFR Part 11(전자 기록 및 서명), 그리고 EU GMP Annex 11은, GxP — Good Practice, 규제된 품질을 아우르는 우산 — 환경에 있는 모든 기록 시스템(system of record)이 검증되고, 접근 통제되고, 감사 추적되고, 변경 통제될 것을 요구합니다 [11]. 그 속성들을 입증할 수 없는 시스템은 배치 결정이 의존하는 기록을 보유할 수 없습니다. (시행 중)
외부 어휘를 가져와 새로운 사실을 추론하는(한 번도 명시적으로 적힌 적 없는 결론을 도출하는) 자기수정형 추론기 구동 온톨로지는 정확히 그 체제 아래에서 검증하기 어려운 종류의 시스템입니다.
규제 당국이 배치 결정에 대해 던질 질문을 던져 보십시오. 추론된 사실은 무엇이었고, 어떤 공리(axiom, 모델이 진술한 논리 규칙)에서 도출되었으며, 어떤 임포트된 온톨로지의 어느 버전 아래에서, 결정이 내려진 바로 그 순간에 그러했는가? 모델이 한 질의와 다음 질의 사이에 당신 발밑에서 바뀔 수 있다면, 그 질문에는 안정적인 답이 없습니다 — 그리고 안정적인 답이 없는 기록은, Part 11과 Annex 11 아래에서, 규제된 시스템이 보유해도 되는 기록이 아닙니다.
그래서 현장은 대신 잠긴 구조화 시스템 위에서 돌아갑니다 — 그것들의 시맨틱이 더 빈약해서가 아니라, 동결되고 서명되고 입증될 수 있기 때문입니다. 추론기를 밖에 묶어 두는 마찰은 규제적인 것이지 기술적인 것이 아니며, 그것을 그렇게 이름 붙이는 것이야말로, 왜 제약에서 시맨틱이 가장 앞선 영역이 동시에 생각하지 않는 데이터에 가장 헌신하는 영역이기도 한지를 이해하는 유일한 길입니다.
같은 게이트, 학습하는 모델 둘레에 그어지다
살아 있는 추론기를 막는 그 논리는 온톨로지에 국한된 것이 아닙니다. 그것은 2025–2026년 규제 당국이 기계학습 모델 둘레에 그은 바로 그 논리이며, 둘을 하나의 규칙으로 보는 것이 이 장을 이 책의 컴패니언 권 Machine Learning & AI for Biomanufacturing에 잇는 가장 깨끗한 길입니다.
초안 EU/PIC/S GMP Annex 22(최초의 제조 특화 AI 규칙, 2025년 7월 협의에 부쳐짐)는 중요(critical) GMP 적용에 대해 오직 정적(static)·결정론적(deterministic) 모델만 허용하며, 자기학습·적응형·생성형·대형 언어 모델 시스템을 그러한 중요 용도에서 명시적으로 배제하고, 어떤 갱신에도 사전 결정된 변경 통제 계획을 요구합니다. 그것을 추론기에 비춰 읽어 보십시오. 자기수정형 추론 온톨로지와 끊임없이 학습하는 모델은 동일한 이유로 검증에 실패합니다. 각각은 오늘과 다르게 내일 답할 수 있으므로, 어느 쪽도 Part 11과 Annex 11이 요구하는 안정적이고 서명 가능한 답 — "그 사실은 무엇이었고, 어떤 버전 아래에서, 결정의 순간에 그러했는가?" — 을 내놓지 못합니다. 추론기(새 사실을 도출하는 추론 소프트웨어)와 끊임없이 학습하는 예측기는 GxP 게이트가 금하는 그것 — 가만히 있지 않는 기록 — 의 두 이름입니다. 모델과 검증 장이 안착하는 해법 — CQA에 닿는 모든 것에 대해 잠그고-나서-재학습(locked-then-relearn), 결코 끊임없이 학습하지 않음 — 은, 규제 스택이 살아 있는 추론기가 아니라 동결된 구조화 데이터로 지어지게 하는 바로 그 해법입니다.
그러나 그 관계는 공유된 금지보다 더 깊이 흐르며, 바로 여기서 온톨로지는 모델과 우리에 함께 갇히는 데 그치지 않고 그 곁의 제 자리를 벌어들입니다. 모델은 유창함을 공급하고, 그래프는 그것이 비춰 점검되는 진실을 공급합니다 — 온톨로지와 AI 장이 그 수를 명시적으로 둡니다. 세 가지 구체적 연결이 그것을 규제 제출로 실어 나릅니다.
- SHACL로 검증된 학습 데이터. 출시 게이트는 비적합 출시를 거부하도록 지어졌습니다. 동일한 형태(shape)가 비적합 검색 또는 학습 집합을 거부합니다. 부분그래프가 모델을 학습시키거나 그라운딩하기 전에, 적합성은 모든 로트가 그
bp:derivedFrom부모를, 모든 CQA가 그 단위를 짊어진 값을(위의 CQ-19 규율), 모든 서명이 그 서명자를 갖췄음을 인증합니다 — 그래서 모델은 그러지 않았다면 학습 기억으로 채워 넣었을 텅 빈 그래프로부터 학습하거나 그것을 인용하는 일이 결코 없습니다. 제출의 구조화 데이터는 바로 그런 SHACL로 점검 가능한 그래프이며, 그래서 규제 경계는 검증된 그라운딩 저장소가 살 법한 가장 자연스러운 곳입니다. - 추론된 그래프, 유창한 모델의 그라운드 트루스로서. 온톨로지에 비춰 점검되는 검색 증강 LLM은 IDMP 파일링을 서술할 수 있습니다 — "
bp:DS-001뒤의 UNII는 무엇이고, 게이트가 통과시킨 출시 패널은 어느 것인가?" — CQ-16이 걷는 바로 그 타입 매겨진 엣지를 순회하며, 지어내는 대신 그 경로를 인용함으로써 말입니다. 그래프가 아는 일을 하고, 모델은 말하는 일을 합니다. 이것이 검증의 역설을 정확히 진술한 것입니다. 추론된 그래프는 한 시점에 동결되고 버전이 매겨지고 입증될 수 있으므로, 그 스냅샷 위에 그라운딩된 모델은 감사 가능한 답을 물려받는 반면, 스스로 추론하거나 학습하는 모델은 그러지 못합니다. 온톨로지는 여기서 추론 능력이 있으면서도 동결 가능한 유일한 구성 요소입니다 — 바로 그래서 배치 가능한 패턴은 자율이 아니라 그라운딩입니다. - 인스턴스 위의 정직한 검증. 학습이 그래프의 인스턴스 위에서 일어날 때 — 캠페인의 로트들에 걸쳐 출시 결과를 예측할 때 — 계보가 곧 그룹 키입니다. 공유 세포은행
WCB-CHO-001로 거슬러 가는bp:derivedFrom순회는, 그룹화·중첩 교차검증이 아첨하는 점수 대신 정직한 점수를 보고하는 데 필요한 leave-one-batch-out(또는 leave-one-cell-bank-out) 분할입니다. 한 은행에서 나온 형제 로트는 거의 쌍둥이이며, 행 단위 무작위 분할은 답을 누설합니다. 일탈을 추적하는 그래프와 누설 없는 검증 폴드를 정의하는 그래프는 같은 그래프입니다.
그 귀결은 이 책 전체가 벌어들여 온 한 문장입니다. 규제 당국은 이미 기록이 동결되고 서명되고 입증될 것을 고집하며, 그 고집이야말로 — 어떤 빠진 표준이 아니라 — 살아 있는 추론기와 끊임없이 학습하는 모델 양쪽이 중요 경로 밖에 머무는 이유이고, 한편 추론되고 잠긴 그래프는 유창한 모델이 검토자에게 거짓말하지 않고 디딜 수 있는 바로 그것입니다.
왜 중요한가
이 책이 지은 SHACL 출시 게이트 — DP-004를 붙들어 두는 규칙 — 는 사고 실험이 아닙니다. DP-004는 별도의, 의도적으로 스펙을 벗어난 완제의약품 로트로, 위 단위 문법 예제에서 쓴 깨끗한 DS-001/BATCH-2026-001 원료의약품 배치와는 구별됩니다(그래서 그 단량체 수치 98.687 %는 앞서 본 98.611 %와 다릅니다 — 같은 숫자를 두 번 보고한 것이 아니라 서로 다른 두 로트입니다). 그것은 DP-004를 한 가지 기준에서, 그리고 현실적인 기준에서 탈락시킵니다. 고분자량(HMW) 응집체 — 뭉쳐 붙은 항체 분자 — 가 2.41 %로 2.0 % 출시 한계를 넘었고, 그동안 단량체 순도(98.687 %)는 스펙 안(허용된 범위 안)에 머뭅니다. 응집체는 면역원성 위험을 짊어지는 가용성-응집 속성으로, 열·교반·기액 계면 스트레스 아래에서 추세가 위로 향하며, CMC 검토자가 동등성 또는 안정성 패키지에서 가장 먼저 캐묻는 숫자 가운데 하나입니다. 단량체 하나만으로 걸리는 게이트는 장난감이겠지만, 다른 모든 패널 값은 적합한 채로 두고 스펙 이탈을 응집체 경로로 정확히 짚어내는 게이트는 실제 출시 결정의 모양입니다.
그것은 KASA의 규칙 기반 평가에, 그리고 IDMP의 강제된 구조화 마스터 데이터에 실세계의 사촌을 두고 있습니다. 둘은 함께, 점검 가능하고 구조화된 의미가 제출 경계에서 이미 규제적 현실임을 — 그 뒤편 GMP 현장에서는 살아 있는 추론 온톨로지가 여전히 드문 와중에도 — 증명합니다. 출하 게이트 장에서 게이트를 지은 독자는, 자기도 잘 모르는 새, 규제 당국 자신의 수(手)를 예행연습해 온 셈입니다.
이 책의 관통선 — 기록을 압박 속에서도 추론할 수 있는 지식으로 바꾸는 것 — 은 바로 여기서 가장 어려운 실세계 시험과 마주합니다. 법은 이미 구조를 요구하지만 검증 체제는 여전히 스스로 생각하는 모델을 금하는 바로 그곳에서 말입니다.
교훈은 온톨로지가 규제의 가장자리에서 실패했다는 것이 아닙니다. 교훈은 구조가 먼저 출하되었고, 추론은, 그것이 올 때, 게이트를 지나 제 길을 벌어들여야 하리라는 것입니다.
핵심 용어
- ISO IDMP — 의약품 식별(Identification of Medicinal Products)을 위한 ISO 표준 군; 물질·제품·조직을 기계가 읽을 수 있는 형태로 기술하도록 EU에서 법적으로 강제됨.
- SPOR — EMA의 네 개 IDMP 마스터 데이터 서비스: Substances, Products, Organisations, Referentials; RMS와 OMS는 2017년부터 운영, PMS는 HL7 FHIR 위에 구축됨.
- GSRS / UNII — FDA/NIH의 Global Substance Registration System과 그것이 발급하는 무료·비독점 Unique Ingredient Identifier 코드; ISO 11238과 ISO/TS 19844를 구현함.
- SPL — Structured Product Labeling, FDA 제품 라벨에 의무인 HL7 v3 XML 표준; NCI Thesaurus 통제 용어, NDC, UNII를 사용함.
- CDISC SEND — FDA가 강제하는 비임상(동물 시험) 데이터 교환 표준; 제조 표준도 CMC 표준도 아님.
- KASA — FDA의 내부 Knowledge-Aided Assessment and Structured Application 플랫폼; 규칙 기반·구조화 데이터 평가 시스템이지 형식 OWL 온톨로지가 아님.
- PQ/CMC FHIR — 구조화된 제품 품질·CMC 데이터를 위한 파일럿 단계의 FHIR R5 구현 가이드; 현재 고형 경구제에 한정됨.
- UCUM — Unified Code for Units of Measure, HL7/FHIR에, 따라서 EMA PMS·SPL·PQ/CMC FHIR에 내장된 단위 문법.
- 추론기 / 추론(Reasoner / inference) — 추론기는 온톨로지가 명시적으로 진술하지 않은 새 사실을 도출하는 소프트웨어이며(추론), 그것이 내리는 결론은 모델이나 임포트된 어휘가 바뀌면 함께 흔들릴 수 있어 그런 추론 결과는 동결하고 입증하기 어렵습니다. 이것이 GxP 게이트가 살아 있는 추론기를 생산 현장 밖에 묶어 두는 이유입니다.
- GxP 검증 체제 — GAMP 5, 21 CFR Part 11, EU GMP Annex 11을 통칭; GxP 기록 시스템이 검증·감사·변경 통제될 것을 요구하는 것으로, 살아 있는 추론 온톨로지의 배치를 어렵게 만듦.
- Annex 22 (잠긴 모델) — 중요 GMP 용도에 정적·결정론적 모델만 허용하고 자기학습·적응형·생성형·LLM 시스템을 배제하는 초안 EU/PIC/S GMP AI 부속서(2025년 7월 협의); 살아 있는 추론기를 현장 밖에 묶어 두는 것과 같은 잠그고-나서-재학습 논리.
- GraphRAG 그라운딩 — 신뢰 저장소가 검증된 지식 그래프인 검색 증강 생성으로, 유창한 모델이 타입 매겨진 엣지(CQ-16 경로)를 순회하고 인용함으로써 파일링을 지어내는 대신 답함; 추론되고 잠긴 그래프가 모델이 환각 없이 디딜 수 있는 그것임.
- 그룹화 / leave-one-batch-out 검증 — 한 로트의 모든 레코드를 — 이상적으로는 한 세포은행에서 나온 모든 로트를 — 학습 또는 시험 한쪽에 통째로 두어, 그래프의 인스턴스 위에서 학습하는 모델이 진정으로 미지의 로트에 대해 채점되도록 하는 것; 공유 세포은행으로 가는
bp:derivedFrom순회가 그룹 키임.
다음 이야기
그렇다면 규제 경계는 구조화된 시맨틱이 가장 성숙하고 가장 강하게 집행되는 곳이며 — 우연이 아니게도 — 점검 가능한 양식과 생각하는 시스템 사이의 경계가 가장 날카롭게 그어지는 곳입니다.
다음 장 제조 현장과 디지털 트윈: 온톨로지가 아직 도착 중인 곳은 공장 자체로 — 살아 있는 장비, 공정 historian, 그리고 형식 모델이 이제 막 나타나기 시작한 디지털 트윈의 야심으로 — 돌아갑니다. 이 장이 방금 이름 붙인 바로 그 검증 체제에 게이트로 막혀 있는 곳입니다.