RESEARCH & SECONDARY USE CONNECTORS
Architecture, Cohorts & Data Pipelines
3 of 6Enable governed secondary use of health data for research, real-world evidence and analytics with privacy, provenance and controlled outputs.
ArchitectureCohortsData CatalogPipelinesMSISPseudonymizationResearch Sandbox
Governed by Design
Control every step with purpose and authorization.
Flexible Data Models
Support FHIR, OMOP, CDISC and future MQL.
High Data Quality
Use semantic normalization, quality and lineage.
Secure Environments
Provide access only inside controlled environments.
End-to-End Research Data Pipeline
1
Research Request
Purpose, legal basis and approval
2
Cohort Definition
Inclusion/exclusion criteria
3
Source Data Discovery
Availability and quality
4
Extraction & Ingestion
Authorized batch/incremental connectors
5
MSIS Normalization
Terminology and reconciliation
6
Transform & Model
FHIR, OMOP, CDISC or study model
7
Pseudonymize
Protect identifiers / risk controls
8
Validate & Version
Quality, lineage and dataset version
9
Secure Environment
Governed analysis and outputs
Key Components
Access & Authorization
Research request, approvals, purpose and RBAC.
Cohort Builder
Reusable inclusion/exclusion and temporal criteria.
Data Catalog
Discover approved sources, fields and quality metadata.
Pipeline Orchestration
Extraction, transformation, versioning and retries.
MSIS
Clinical semantic normalization and provenance.
Secure Research Environment
Controlled tools, network and output review.
Cohort Definitions
Clinical concepts and value sets
Demographic criteria within authorized scope
Temporal relationships and observation windows
Encounter/care setting requirements
Inclusion/exclusion versioning
Preview counts subject to privacy controls
Data Pipelines
| Stage | Inputs | Controls |
|---|---|---|
| Extract | Authorized source datasets | Purpose/source allowlist |
| Normalize | Clinical source values | MSIS terminology + original-value preservation |
| Transform | Normalized data | Versioned model/derivation rules |
| Pseudonymize | Approved analytical fields | Privacy-risk controls |
| Validate | Candidate dataset | Quality/conformance checks |
| Publish to sandbox | Versioned dataset | Access policy + audit |
Data Quality & Lineage
Source dataset/version and extraction timestamp
Mapping/terminology version
Transformation code/config version
Record/field-level quality flags where appropriate
Pseudonymization policy/version
Final dataset immutable version identifier
Security & Governance
No pipeline runs without approved purpose and scope
Use least-privilege service identities
Keep raw identifiable staging tightly restricted
Encrypt data in transit/at rest
Audit pipeline execution and data access
Expire datasets/access according to project policy
Developer Integration Surface
| Surface | Operation / resource | Use | Status |
|---|---|---|---|
| Research jobs API | create / status / cancel pipeline job | Orchestration | Planned/versioned |
| FHIR Bulk Data | authorized source extraction | FHIR large-scale export | Capability-dependent |
| Data model export | OMOP/CDISC/study dataset | Research transformation | Planned/evolving |
| Events | job.started / failed / ready_for_review | Async pipeline workflow | Planned/evolving |
Next Steps
Approve request and source scope
Build/version cohort
Configure extraction pipeline
Run MSIS normalization and transformation
Pseudonymize/validate/version
Publish to secure environment