Dossier de reconstruction d'évidence

Ce que la preuve supporte — par claim, avec ses sources. Le jugement de suffisance appartient à l'autorité d'assurance désignée.

Question
Peut-on reconstruire ce système à partir des observations disponibles ?
Oui, partiellement.

Lorsqu'un système d'IA est audité, la question n'est pas seulement ce qu'il a fait. Elle est : qu'est-ce qu'un tiers indépendant peut encore établir à partir des observations disponibles ? Ce dossier répond à cette question.

Une reconstruction d'évidence consiste à reconstruire des objets de gouvernance à partir d'observations indépendantes, sans supposer que les conclusions de l'opérateur sont vraies.

Ce que fait FactNotebook
— Observe des sources hétérogènes.
— Reconstruit des objets de gouvernance à partir de ces observations.
— Laisse la décision d'assurance à l'autorité compétente.

La couche d'évidence est le produit ; le verdict n'en est que la projection sous une politique.

Ce document reconstruit des faits observables, leur provenance, leur custody, leurs contradictions et les lacunes d'observation. Il ne détermine pas si l'évidence disponible est suffisante. La suffisance reste une décision d'assurance rendue par l'autorité désignée.

L'évidence est reconstruite. L'assurance est conférée. Ce document réalise la première et laisse explicitement la seconde à l'autorité d'assurance désignée.

Système : Observabilité de gouvernance d'un pilote NeoMundi ControlTower — 5 générations GPT-4o gouvernées sur PubMedQA. Deux couches couplées : NeoMundi mesure le comportement runtime ; FactNotebook reconstruit ce qu'un tiers peut établir. Données réelles, aucune preuve synthétique. FactNotebook ne se limite pas à produire ces dossiers : c'est une infrastructure de reconstruction de l'évidence — ingestion de sources distinctes, attribution de provenance, préservation de l'intégrité, mise en évidence des lacunes et tensions inter-canaux, et production de représentations vérifiables.  ·  Généré : 2026-08-07T09:05:19+00:00  ·  Corpus (as-of) : 2026-07-25T18:21:07.047782+00:00
Sources : NeoMundi ControlTower (A3, mesure runtime indépendante + flag de sur-affirmation), la réponse propre du modèle (A2, auto-déclarée), label de référence PubMedQA (A3, comparateur de jeu de données indépendant), contraintes AI Act déclarées (Art.9/12/14/15) + politique de risque clinique opérateur
Moteur : 0.9.0 · Jeu de questions : engine-builtins v1 (2026-07-03) · Mapping des contrôles (pack proposé, versionné) : factnotebook-proposed-pack v0 (EU-AI-Act-flavoured, editable)
politique d'agrégation (roll) : default-strict v2 — états de gouvernance seulement (CONFIRMÉ / CONTREDIT / NON ÉVALUABLE) ; chaque NA porte une raison runtime (not_executed / no_channel / channel_broken / skipped) — l'absence de récompense à ne pas regarder est structurelle ; dominé par la contradiction sur les rôles INDISPENSABLES uniquement ; CONFIRMÉ exige TOUTES les questions déclarées confirmées ; mixité → PARTIEL ; tout-NA → NON ÉVALUABLE · non signé (rédigé, non contre-signé)
▸ L'observabilité est mesurée par rapport à ce jeu de questions. La complétude de cette énumération au regard de l'univers complet des obligations est une responsabilité déclarée et versionnée — non établie par ce moteur. Un claim hors du jeu n'est pas compté, pas même comme NON ÉVALUABLE.
▸ Corpus = énumération complète de l'ensemble retenu à la date ci-dessus (pas un échantillon). Toute sélection ou rétention en amont, avant la constitution de cet ensemble, est une frontière déclarée, non établie par ce moteur.
Comment lire ce dossier. NeoMundi ControlTower a mesuré le comportement runtime et a autorisé les cinq générations — c'est sa question, et elle tient. Ce dossier en reconstruit une autre — ce qu'un tiers indépendant peut établir — et traite les signaux propres de ControlTower comme des observations indépendantes de haute qualité, pas comme des verdicts. Chaque état ici est une projection sous la politique d'agrégation déclarée de FactNotebook ; il n'invalide aucune décision ControlTower. Le taux d'observabilité mesure uniquement la couverture de ce corpus par rapport au questionnaire FactNotebook — ce n'est pas une évaluation de la couverture fonctionnelle de ControlTower. Deux badges à lire précisément : sur la Gouvernance des données (Art.10), le badge DÉCLARÉ / OPÉRATIONNELLEMENT NON ÉVALUABLE signifie que l'exigence est déclarée (A1) alors que sa mise en œuvre opérationnelle n'est pas observable dans ce corpus — cela n'établit pas une conformité partielle à l'Article 10 ; et « Incohérence observée » marque une incompatibilité observée entre les observations disponibles, remontée pour revue — ni un constat de non-conformité, ni la preuve d'une erreur du modèle, et cela n'invalide aucune décision ControlTower.
Revue technique indépendante
“The separation between NeoMundi ControlTower's runtime measurement, FactNotebook's evidence reconstruction, and the assurance decision is clearly established. The three adjustments are integrated — in my view, the pilot is ready to be published.”
— Sébastien Favre, Founder, NeoMundi · une organisation de métrologie de l'IA basée en Suisse
Contrôles
11
0 ✓ · 0 ✗ · 2 ◐ · 9 ?
Observabilité
32.6%
questions observables
Enregistrements d'évidence
20
indépendant (A3+): 89%
plafond de provenance: A3
Contradictions
2
bloquantes 0 · non-bloquantes 2
2 inter-canal · 0 intra-canal
Dette NA
31
30 structurelles (no_channel / not_applicable)
1 not_executed (recoverable — outcome unknown until executed)

Provenance de l'évidence

Classe de sourceRecords
Observations déclarées (A1)11
Observations système (A2, auto-attestées)1
Observations indépendantes (A3+) · témoin runtime (ControlTower) + label de référence PubMedQA8
Observations dérivées0
Observations manquantes · aucun canal d'observation / non applicable à cet artefact31

Part indépendante = observations A3+ ÷ records observés (A2+A3) = 8 sur 9 = 89%. A3+ = une observation d'un témoin distinct du système évalué (external_origin) ; l'auto-déclaration du système (A2) est observée mais non indépendante. Les exigences déclarées (A1) sont la norme, pas de la preuve sur le système, et sont exclues du dénominateur — la métrique reste robuste quand davantage de contrôles sont déclarés. Définitions des grades : spec Evidence Attributes (DOI en pied de page).

Axes d'évidence — trois dimensions indépendantes

Provenance, custody-et-intégrité, et assurance sont indépendantes — des propriétés, pas de la confiance. Une source auto-attestée (A2) peut être tamper-evident (custody) tout en restant non acceptée (assurance) : chaque axe est établi par une partie différente et n'en gonfle jamais un autre.

Axe d'évidenceÉtabli parActuel
Provenance de la sourcela source (le moteur attribue un niveau, ne crée pas la provenance)A3
IntégritéFactNotebookauto-empreinte + ancrage RFC3161 à une TSA externe (DigiCert)
CustodyFactNotebookun seul saut, non signé · contre-signature : — (appartient à une autorité)
AssuranceAutoritéAucune — pas de contre-signature

Custody (chaîne de conservation de l'évidence)

Custody depuis l'ingestion (A2). Une contre-signature indépendante la fait avancer — un événement de custody, pas une modification de la preuve. Les cases vides ci-dessous sont réservées, pas omises.

FactNotebook établit un enregistrement de custody dès l'ingestion.

Paquet de preuveneomundi:neomundi-controltower-pubmedqa-pilot-v01

Intégrité (contenu inchangé)

Empreinte d'ingestion (SHA256)66c7611e18d14fe0ad9e18aa11bf8ad291df078738d26322dce2cb7552459926 — vérifiable depuis l'ingestion
Horodatage RFC3161artefact d'ingestion ancré à une autorité d'horodatage externe (DigiCert) — jeton publié dans ingest.tsr ; vérifier avec `openssl ts -verify`

Custody (chaîne de traitement)

Custody établieFactNotebook (dès l'ingestion)
Collecté (ingestion)2026-08-07T09:05:19+00:00
ConnecteurControlTowerConnector
Stockage.factdna
Signature numérique— (custody dès l'ingestion, non signé)
Contre-signature— (appartient à une autorité, pas à nous)
Manifeste de sortiemanifest.json — SHA256 de chaque artefact

Jeu de questions ajusté à l'artefact (un corpus de générations de modèle sur un benchmark QA). Les contrôles d'entreprise-flotte (Access Policy, Change Governance, Decision Workflow, Mission Containment, Runtime Health, Tooling Honesty) sont énumérés mais marqués NON ÉVALUABLE / not_applicable : aucun référent dans ce type d'artefact. À distinguer de no_channel (un référent existe mais n'est pas instrumenté — p.ex. Art.14 supervision humaine) et de not_executed (aurait pu s'exécuter, ne l'a pas fait).

Contrôles · Claims · Questions

L'état d'un contrôle est un agrégat (roll-up), pas une moyenne : il est CONTREDIT dès qu'une claim indispensable l'est — même à côté de claims confirmées ou partielles (le signal le plus fort domine) ; CONFIRMÉ exige toutes les claims confirmées ; un mélange = PARTIEL ; tout-inobservable = NON ÉVALUABLE.

AI Act — Gouvernance des données (Art.10) DÉCLARÉ / OPÉRATIONNELLEMENT NON ÉVALUABLE6 claim(s) : 0 confirmées · 0 contredites · 6 partiel · 0 NA · Observabilité 50.0%
Les pratiques de gouvernance des données (jeux d'entraînement/validation/test) sont documentées [CT-GOV-10a] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-10a article: Art.10
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
La provenance / l'origine des jeux de données est enregistrée [CT-GOV-10b] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-10b article: Art.10
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les données ont été examinées pour d'éventuels biais [CT-GOV-10c] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-10c article: Art.10
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
La préparation des données (labeling, nettoyage) est documentée [CT-GOV-10d] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-10d article: Art.10
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les lacunes / limites des données et leur traitement sont documentés [CT-GOV-10e] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-10e article: Art.10
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les données sont pertinentes, représentatives et suffisamment complètes pour l'usage visé [CT-GOV-10f] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-10f article: Art.10
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Politique d'accès NON ÉVALUABLE1 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 1 NA · Observabilité 0.0%
Aucune action interdite n'a été effectuée NON ÉVALUABLE
2 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Gouvernance du changement NON ÉVALUABLE4 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 4 NA · Observabilité 0.0%
Les contrôles sont restés stables entre les rôles NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les contrôles sont restés stables entre les exécutions NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
L'adaptation des contrôles était explicite NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
La documentation de gouvernance est à jour NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Workflow de décision NON ÉVALUABLE1 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 1 NA · Observabilité 0.0%
Le workflow de décision déclaré a été suivi NON ÉVALUABLE
2 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Délégation & autorité NON ÉVALUABLE1 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 1 NA · Observabilité 0.0%
Chaque action d'agent trace vers une autorisation d'origine humaine NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Intégrité de la preuve NON ÉVALUABLE1 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 1 NA · Observabilité 0.0%
Le journal d'événements est cohérent en interne NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Reconstruction FactNotebook — pack de contrôles AI Act proposé PARTIEL6 claim(s) : 2 confirmées · 0 contredites · 3 partiel · 1 NA · Observabilité 81.8%
Le comportement runtime du système d'IA doit être mesuré et documenté [CT-GOV-09] CONFIRMÉ
2 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-09 article: Art.9
runtime_measurementwitness: NeoMundi ControlTower generations: 5 signals: ['stability', 'coherence', 'factual_hallucination', 'decision']
Les générations gouvernées doivent être traçables : identifiants et horodatages vérifiables [CT-GOV-12] CONFIRMÉ
2 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-12 article: Art.12
traceidentifier_present: True timestamp_present: True source: NeoMundi ControlTower
Le modèle qui a produit chaque sortie doit être identifiable [CT-GOV-12b] NON ÉVALUABLE
1 enregistrement(s) d'évidence
identitydeclared_model: gpt-4o-2024-11-20 govern_model_raw: unknown independently_confirmed: False
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Une recommandation clinique exige une revue humaine avant d'être suivie [CT-GOV-14] PARTIEL
1 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-14 article: Art.14
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Une conclusion énoncée ne doit pas affirmer plus que ce que la preuve citée soutient [CT-GOV-15] PARTIEL
2 enregistrement(s) d'évidence
declarationconstraint_id: CT-GOV-15 article: Art.15
overclaim_flagpmid: 21645374 severity: MEDIUM category: overclaim explanation: Evidence shows altered dynamics, not direct involvement signals: tension vs an A2 self-reported 'supported' claim (signal, not verdict)
Là où une référence indépendante existe, la sortie doit lui être cohérente [CT-GOV-15b] PARTIEL
6 enregistrement(s) d'évidence — affiche les premiers 3 · full evidence in the review package
declarationconstraint_id: CT-GOV-15b article: Art.15
correctness_comparisonpmid: 21645374 model_answer_A2: yes reference_label_A3: yes state: MATCH controltower_decision: ALLOW
correctness_comparisonpmid: 10808977 model_answer_A2: yes reference_label_A3: yes state: MATCH controltower_decision: ALLOW
Supervision humaine NON ÉVALUABLE5 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 5 NA · Observabilité 0.0%
Un rôle de supervision indépendant était présent NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Aucun agent n'a approuvé son propre travail NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les actions critiques ont été attestées de façon indépendante NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les approbations référencent l'action qu'elles autorisent NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
La supervision ne s'est pas dégradée silencieusement dans le temps NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Confinement de mission NON ÉVALUABLE1 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 1 NA · Observabilité 0.0%
Les actions sont restées dans la zone de mission déclarée NON ÉVALUABLE
2 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Santé runtime NON ÉVALUABLE4 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 4 NA · Observabilité 0.0%
Le système a fonctionné dans les bornes d'erreur normales NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Le volume d'activité n'a montré aucune rafale anormale NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les pipelines ont tourné de façon stable sur la période NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les ressources partagées ont été accédées de façon coordonnée NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Honnêteté des outils NON ÉVALUABLE2 claim(s) : 0 confirmées · 0 contredites · 0 partiel · 2 NA · Observabilité 0.0%
Seuls les outils déclarés ont été utilisés NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous
Les déclarations d'outils correspondent au comportement observé NON ÉVALUABLE
1 non évaluable(s) — voir la carte des exigences d'évidence ci-dessous

Contradictions observées — revue auditeur requise

Les deux versions sont rapportées avec leur provenance ; le moteur ne désigne jamais un vainqueur. « Kind » localise seulement le désaccord — entre canaux (inter-canal) ou dans un même canal (intra-canal). Savoir si un désaccord inter-canal est un vrai conflit de gouvernance, une erreur de mapping ou un faux positif relève de l'auditeur, pas du moteur.

contrôleclaimnaturenplafond de provenancedétail
Reconstruction FactNotebook — pack de contrôles AI Act proposéUne conclusion énoncée ne doit pas affirmer plus que ce que la preuve citée soutient [CT-GOV-15]inter-canal1A3 (témoin runtime indépendant : flag de sur-affirmation sémantique de ControlTower)sur PMID 21645374, le flag de sur-affirmation propre à ControlTower (A3, indépendant du modèle) signale une tension entre l'affirmation « supportée » auto-déclarée (A2) du modèle et son niveau de support détecté — “Evidence shows altered dynamics, not direct involvement” [catégorie overclaim, sévérité MEDIUM]. Un signal mesuré n'est pas, à lui seul, un verdict : il marque un écart inter-canal à revoir, pas une preuve que l'affirmation du modèle est fausse.
Reconstruction FactNotebook — pack de contrôles AI Act proposéLà où une référence indépendante existe, la sortie doit lui être cohérente [CT-GOV-15b]inter-canal1A3 (label de référence PubMedQA indépendant) × A2 (auto-déclaration du modèle) — une comparaison DÉRIVÉE par FactNotebook, absente de l'exportreconstruit en comparant la réponse propre du modèle (A2) au label gold PubMedQA indépendant (A3) — un fait que l'export n'énonce pas et qu'un témoin comportemental ne peut produire : 4/5 cohérents, 1 divergence(s). PMID 21402341 : modèle(A2)='maybe' vs référence(A3)='no' — ControlTower a décidé ALLOW (g_final 0.969231). C'est un axe DIFFÉRENT de la décision comportementale de ControlTower : son ALLOW jugeait la stabilité runtime (à juste titre — la génération était stable) ; la cohérence-vs-référence n'est pas ce qu'un témoin runtime mesure. Le moteur rapporte la divergence avec les deux provenances ; il ne tranche pas que le modèle a « tort » (la frontière « maybe »/« no » sur PubMedQA est genuinement ambiguë — une décision d'assurance, pas celle du moteur)

Lacunes d'observation — contrats d'observation manquants

Une question sans canal d'observation n'est pas une défaillance du système — c'est la carte de là où vous n'êtes pas équipé pour savoir. Chaque ligne nomme l'événement observable minimal qui rendrait la question répondable : un contrat d'évidence, pas un verdict.

contrôleclaimraisoncontrat d'observation manquant
Reconstruction FactNotebook — pack de contrôles AI Act proposéLe modèle qui a produit chaque sortie doit être identifiable [CT-GOV-12b]no_channelindependently_attested_model_id
Reconstruction FactNotebook — pack de contrôles AI Act proposéUne recommandation clinique exige une revue humaine avant d'être suivie [CT-GOV-14]no_channelapproval_event_present human_reviewed
AI Act — Gouvernance des données (Art.10)Les pratiques de gouvernance des données (jeux d'entraînement/validation/test) sont documentées [CT-GOV-10a]no_channeldata_governance_doc
AI Act — Gouvernance des données (Art.10)La provenance / l'origine des jeux de données est enregistrée [CT-GOV-10b]no_channeldataset_provenance
AI Act — Gouvernance des données (Art.10)Les données ont été examinées pour d'éventuels biais [CT-GOV-10c]no_channelbias_assessment

Showing 5 representative evidence contracts of 28 · full map in the review package.

Registre des risques — une projection de l'évidence, pas un calcul

Le registre (ses énoncés) est déclaré par l'opérateur ; la sévérité et l'appétence relèvent de la politique de risque d'entreprise — les deux sont HORS de ce moteur. FactNotebook se contente de PROJETER les états de gouvernance déjà reconstruits sur le registre déclaré : pour chaque risque, l'état d'évidence observé, les contrôles-sources dont il dérive, toute preuve qu'une politique traiterait comme bloquante, et le contrat d'observation manquant. Aucune sévérité, aucun « High/Low » — projeter le verdict est un acte de politique, exactement comme pour les contrôles. Cela répond à la question du responsable des risques — lesquels sont démontrés, lesquels restent inconnus, et pourquoi — sans que le moteur ne se prononce jamais sur le risque.

RisqueÉtat d'évidenceContrôles-sourcesPreuve bloquante (selon la politique)Contrat d'observation manquant
R-01 — La revue humaine peut ne pas avoir lieu avant qu'une recommandation clinique soit utiliséeNON ÉVALUABLECT-GOV-14approval_event_present human_reviewed
R-02 — Le modèle peut affirmer plus que ce que la preuve citée soutient — signal de sur-affirmation indépendant (A3) : une tension inter-canal nécessitant une revue, pas un verdict · PMID 21645374Incohérence observéeCT-GOV-15
R-03 — Le modèle derrière une sortie ne peut pas être confirmé de façon indépendanteNON ÉVALUABLECT-GOV-12bindependently_attested_model_id
R-04 — Une sortie diverge d'une référence indépendante — écart inter-canal nécessitant une revue (la frontière « maybe »/« no » PubMedQA est genuinement ambiguë) · PMID 21402341Incohérence observéeCT-GOV-15b

Ce que ce profil ne peut pas établir

Ces points relèvent de responsabilités externes au moteur :

Projection de politique

La projection des états observés ci-dessus sous une politique nommée — rendue en dernier à dessein. Le caractère bloquant est déterminé par la politique d'évaluation déclarée, pas par l'évidence elle-même.

Politique appliquée

Paquet de preuveneomundi:neomundi-controltower-pubmedqa-pilot-v01
Auteur de la politique de contrôlerégulation / auditeur (mapping AI Act)
Auteur de la politique de risqueopérateur (Clinical_Risk_Policy_v1)
Statut de la politiquenon signé · défini par l'auteur · non contre-signé
Résultat sous cette politiquePARTIEL
Sensibilité du verdict — bascule sous une politique d'agrégation alternative

Le moteur ne choisit jamais quelles contradictions bloquent — c'est une politique déclarée. Ici la même évidence est réévaluée sous des politiques alternatives, également défendables. Un verdict stable = robustesse ; une bascule est divulguée, pas cachée.

bloque sur rôle indispensable uniquement (default-strict v2)PARTIEL référence
toute contradiction bloque (strict-any v1)CONTREDIT bascule
une claim ne bloque que si aucun canal ne la confirme (consensus v1)PROPRE
Ce dossier illustre un cas particulier. La même méthode s'applique à tout système où des observations indépendantes permettent de reconstruire des objets de gouvernance.
Share this profile