Données de santé synthétiques — admissibilité, réclamations médicales et pharmaceutiques

Des réclamations qui racontent
une histoire clinique cohérente.

Aucun modèle ne s'exécute lorsqu'un corpus est généré. Chaque réclamation est assemblée à partir d'un gabarit cohérent par construction, et chaque ligne remonte à l'événement clinique qui l'a produite.

Healthcare Corpus génère des membres, des périodes d'admissibilité, des réclamations médicales professionnelles et institutionnelles et des réclamations pharmaceutiques synthétiques — tarifés selon les fichiers de tarification publics des CMS, adjugés selon la conception des garanties de chaque régime, et reproductibles à l'octet près à partir d'une graine.

Demander une démo Voir comment ça fonctionne ↓
12
Tables dans chaque corpus,
plus un manifeste d'exécution
Aucun
Appel de modèle lorsqu'un
corpus est généré
0
Code non résolu toléré —
un seul interrompt l'exécution
100%
Synthétique : aucune personne,
aucun fournisseur ni payeur réels
Toutes les données produites sont synthétiques
Elles ne décrivent aucune personne, aucun fournisseur ni aucun payeur réels, chaque ligne de faits porte data_source = SYNTHETIC, et elles ne doivent jamais servir à des décisions cliniques, financières ou de couverture.
Personnes réelles dans les données
Aucune
Appels de modèle à l'exécution
Aucune
Mêmes intrants, même graine
Mêmes octets
La situation actuelle

Des données de test qui ne testent rien.

Les systèmes qui ont le plus besoin d'être testés sont conçus pour repérer précisément ce que les données synthétiques ordinaires ont de faux — ou ne contiennent jamais.

Les jeux faits main sont trop propres

Ils sont petits, et ils passent les contrôles d'un pipeline parce qu'ils ne contiennent rien de ce que ces contrôles existent pour attraper.

Des codes au hasard, un non-sens clinique

Valides code par code, faux dans l'ensemble : un diagnostic qui ne justifie pas l'acte, un acte facturé là où il ne peut pas avoir lieu, un médicament pour une affection que le membre n'a pas.

Les données de production ne voyagent pas

Le développement, le travail en sous-traitance ou à l'étranger, l'évaluation de fournisseurs et les démonstrations de vente exigent tous des réclamations réalistes — sans accès aux données de production.

Aucune vérité de référence pour mesurer

Évaluer une règle de fraude ou un modèle de risque exige de savoir quels membres devraient être signalés. Un corpus dont les comportements ont été rédigés le sait ; les données réelles le disent rarement.

Comment ça fonctionne

Du persona à la réclamation tarifée.

Un persona décrit un patient type sous forme de taux et de proportions. Une cohorte tirée d'un mélange de personas est inscrite à des régimes, puis déroulée dans le temps.

01
Rédiger les spécifications
Une spécification de cohorte, une spécification de garanties par régime, des profils cliniques et des personas — en YAML révisé et versionné, qu'un clinicien ou un analyste des garanties peut vérifier sans lire de code.
02
Charger et contrôler
Chaque table de référence est chargée et vérifiée, et chaque code rédigé doit se résoudre dans sa table à version figée. Une table manquante ou un code non résolu arrête l'exécution avant qu'une seule ligne existe.
03
Dérouler la cohorte
Les membres sont regroupés en ménages et inscrits. Les affections produisent des épisodes, les épisodes des rencontres, et chaque rencontre devient des réclamations par son gabarit.
04
Tarifer, adjuger, écrire
Montants admissibles tirés des fichiers de tarification publics des CMS, partage des coûts selon les cumulateurs du régime, refus et délais de paiement tels que chaque régime les définit. Les contrôles d'intégrité passent d'abord : un corpus qui échoue n'est jamais écrit.
Healthcare Corpus — trace clinical_event Illustratif
Membre M-104233 — Persona A
PPO commercial · Épisode : événement cardiaque aigu · data_source = SYNTHETIC
Persona A Hospitalisation anchored
Réclamations issues de cette rencontre
Réclamation d'établissement · MS-DRG 309837I / UB-04
Réclamation professionnelle · POS 21 · Dx I48.0837P / CMS-1500
Pourquoi cette ligne existe-t-elle ?
Une rencontre, deux réclamations — l'hospitalisation produit une réclamation professionnelle et une réclamation d'établissement jumelées, concordantes par construction.
allowed_basis = anchored — tarifé à partir d'une vraie table publique des CMS, pas inventé.
Généré à partir des spécifications — aucun appel de modèle
Où s'exécute le modèle

Le modèle rédige des spécifications, jamais des lignes.

L'assistance de l'IA se limite à la rédaction des fichiers de spécification, qu'une personne révise avant qu'ils soient validés. La génération est du Python déterministe appliqué aux spécifications, aux tables de référence et à une graine.

Rédaction — assistée par l'IA
Le récit d'un persona devient un profil clinique de taux et de proportions, qui puise dans des catalogues réutilisables d'épisodes, de gabarits de rencontre, de jeux de codes d'affection et de schémas thérapeutiques.
Révision — consignée dans chaque document
Chaque spécification nomme les révisions reçues — clinique, facturation, garanties — avec le réviseur et la date. Modifier un contenu révisé efface l'attestation : un nom ne couvre jamais un contenu qu'il n'a pas révisé.
Exécution — aucun modèle, jamais
Le générateur n'appelle jamais de modèle, et le modèle n'émet jamais une ligne de données. Toute décision clinique que le générateur semblerait devoir prendre appartient plutôt à une spécification.
4
Artefacts de spécification, un rôle chacunCohorte, conception des garanties, profil clinique et persona. Un validateur inter-fichiers fait respecter les frontières, et rien dans le générateur ne dépend d'un persona en particulier.
12
Tables, plus un manifeste d'exécutionMembres, admissibilité, réclamations professionnelles, institutionnelles et pharmaceutiques, fournisseurs et dimensions de couverture — et clinical_event, qui explique pour toute réclamation pourquoi la ligne existe.
3
Niveaux de validation à la relectureUn corpus écrit est relu sur disque et vérifié pour sa structure, pour ses codes selon les versions figées et pour sa plausibilité clinique — par un banc d'essai qui ne partage aucun code avec le générateur.
1 graine
Des sorties identiques à l'octetLes mêmes spécifications, versions de référence et graine donnent les mêmes octets. Le membre n d'un persona est le même dans une exécution de 100 membres ou de 100 000, sur un nœud ou sur quarante.
Conçu pour votre équipe

Une vérité de référence connue,
pour chaque équipe.

Des réclamations réalistes et cohérentes, sans renseignements personnels sur la santé — pour le travail où savoir exactement ce que contiennent les données est tout l'enjeu.

Testez le pipeline
contre un fichier de référence.

Éprouvez l'ingestion, le mappage vers le modèle canonique et le chargement de l'entrepôt avec les trois familles de réclamations, au niveau de l'en-tête et de la ligne, et des périodes d'admissibilité avec interruptions et changements de régime — à n'importe quel volume, de façon reproductible.

3
Familles de réclamations :
professionnelles, institutionnelles, pharmacie
12
Tables
par exécution
Tests de régressionDes intrants identiques donnent des octets identiques : un changement de pipeline qui modifie les résultats en aval ressort dans un diff.
Tests de charge et de performanceLa taille se règle en années-membres, pas en nombre de lignes. Une cohorte plus grande tient en une ligne, et l'exécution dans JetStore la répartit sur plusieurs nœuds.
Développement de règles de qualité des donnéesUne intégrité garantie — réclamations dans la période de couverture, dates ordonnées, totaux égaux à leurs lignes — fournit une base propre et connue pour ajuster vos propres règles.
Une admissibilité qui bouge vraimentDes ménages inscrits par périodes de couverture, avec interruptions, changements de régime et fins de couverture tels que la cohorte les définit.

Mesurez la détection
contre une réponse connue.

Les signatures comportementales sont rédigées plutôt qu'espérées, et chaque ligne porte le persona qui l'a produite — une règle peut donc être évaluée pour sa sensibilité et pour ses faux positifs, avec persona_id comme étiquette.

Fraude, gaspillage et abusLe persona de démonstration en quête d'opioïdes produit des prescripteurs multiples, des renouvellements hâtifs et des exécutions qui se chevauchent, aux taux rédigés. Aucun autre persona n'en produit.
Analytique pharmacie et gestionnaires de régimes d'assurance médicamentsPaliers de formulaire, médicaments de spécialité, observance selon des plages rédigées de proportion de jours couverts et annexes de substances contrôlées, tarifés selon des fichiers publics de prix des médicaments.
Gestion des soins et stratification du risqueDes membres polychroniques, gériatriques et pédiatriques atteints de maladies rares, avec trajectoires et mortalité, pour la logique de stratification et les flux de travail sur les lacunes de soins.
Santé mentale et consommation de substancesHospitalisation psychiatrique, trouble lié à l'usage de substances et délivrance de substances contrôlées, modélisés avec exactitude et sans euphémisme.

Gardez la population constante.
Changez le régime.

Un profil clinique ne contient ni montants ni mécanique de régime : la même population peut donc être inscrite à deux régimes, cliniquement identique et différente seulement par la conception des garanties.

Tests des moteurs d'adjudication et de tarificationMontants admissibles ancrés dans les fichiers des CMS ; partage des coûts par franchises, coassurance et cumulateurs de débours, individuels et familiaux ; refus aux taux rédigés.
Simulation de conception des garantiesComparez le partage des coûts, l'épuisement des franchises et la part du membre, le contenu clinique restant exactement le même.
Flux de travail Medicare AdvantageColonnes d'admissibilité et vocabulaires de statut propres à Medicare, aux côtés des membres de régimes commerciaux.
L'argent réel distingué de l'argent inventéChaque montant admissible est classé anchored, positioned ou declared : l'utilisateur sait quels montants une vraie table publique a tarifés.

Réaliste dès le premier jour.
Partageable avec tous.

Comme le corpus ne contient aucun renseignement personnel sur la santé, il peut aller là où les données de production ne vont pas : chez un client potentiel, un fournisseur concurrent, une nouvelle recrue ou un sous-traitant.

Démonstrations de produits et ventesUne population réaliste dès le premier jour, partageable avec un client potentiel.
Évaluation de fournisseurs et de plateformesRemettez à des fournisseurs concurrents le même corpus reproductible.
Formation et intégrationAnalystes et ingénieurs apprennent les données de réclamations sur des enregistrements dont chaque ligne remonte à sa raison d'être.
Environnements de développement sans renseignements de santéLe développement, le travail à l'étranger et en sous-traitance se font sans accès aux données de production.
La confiance par construction

Chaque ligne traçable.
Chaque licence respectée.

Un corpus dit ce qu'il est : quel persona et quel événement ont produit chaque ligne, quels montants sont réels, quels codes sont réels, et quelle version de chaque table a répondu.

Synthétique seulement
data_source = SYNTHETIC sur chaque ligne de faits
Références figées
Version, date, SHA-256 et nombre de lignes
Traçabilité complète
Chaque ligne de faits porte run_id, persona_id, event_id et data_source. Le manifeste d'exécution consigne la graine, la version du générateur, ainsi que la version et la somme de contrôle de chaque spécification et de chaque table de référence utilisées.
Transparent sur les montants fabriqués
Chaque montant admissible est classé anchored (une vraie table publique de tarification l'a établi), positioned (fabriqué, mais situé par rapport à la population tarifée d'une vraie table) ou declared (fabriqué, sans rien de public derrière).
Conçu en fonction des licences
Les jeux de codes publics sont livrés avec le produit. Les jeux sous licence — CPT, NUBC, NCPDP, X12 et autres — sont fournis par votre installation, qui détient la licence ; le produit ne fait que les lire et n'en copie jamais aucun.
Un faux code a toujours l'air faux
Là où un site n'a pas une table sous licence, il utilise un substitut dont chaque code commence par ZZ et chaque description par SYNTHETIC — un code fabriqué ne peut donc jamais passer pour un vrai.
Une table manquante est fatale
Si une table dont l'exécution a besoin est absente, l'exécution s'interrompt au démarrage en nommant la table et le chemin cherché. Un corpus privé en silence de ses lignes CPT aurait l'air complet sans l'être.
Aucune connexion réseau à l'exécution
La commande installée n'ouvre jamais de connexion réseau. Les données de référence sont récupérées et actualisées par des scripts distincts et supervisés, jamais par une exécution.
Autonome, ou dans JetStore
Exécutez-le en ligne de commande sur une seule machine, ou comme opérateur dans un pipeline JetStore, partitionné par ménage sur plusieurs nœuds — avec des sorties mesurées identiques à l'octet à celles de la commande autonome.
Ce qu'il n'est pas

Dit clairement, pour que les attentes soient justes.

Pas calibré sur une population réelle

Il reproduit les taux que ses auteurs ont rédigés, pas la prévalence réelle, les distributions de coûts ni les courbes d'utilisation. La calibration sur des références publiées est un travail à venir.

Il ne vous surprendra pas

Tout ce qu'il contient a été rédigé, et la longue traîne n'est longue que dans la mesure où elle est écrite. Il sert aux tests, aux démos et à la formation — pas à apprendre ce qui se passe dans une population réelle.

Des lacunes voulues et consignées

La coordination des prestations est hors du champ, et les codes de motif de refus ne sont pas écrits : un refus tiré selon un taux n'a aucun motif que le corpus puisse honnêtement nommer.

Prévu, pas encore produit

Autorisations préalables, résultats de laboratoire, données d'évaluation des risques pour la santé et de déterminants sociaux, sérialisation X12 ou FHIR, réseaux d'orientation, capitation et paiement fondé sur la valeur.

Voyez un corpus bâti pour
votre population.

Dans un mandat de déploiement, vos populations, vos régimes et vos profils d'utilisation sont rédigés sous forme de spécifications, révisés, puis générés dans votre propre environnement, sous vos propres licences de jeux de codes.

Demander une démo Demander l'aperçu technique
Contact

Vous avez une question ? Parlons-en.

Écrivez-nous pour en savoir plus sur Healthcare Corpus et les mandats de déploiement, ou pour amorcer la conversation avec notre équipe.

info@artisoft.io