NakedSignal OS · Documentation
Back to the consoleDocumentation

Trust Graph

LIVE

Every benchmark result is otherwise an island. This is the same evaluation record projected into a graph — models, tasks, datasets, modalities, held-out generations and acquisition settings as nodes, and the relations between them as edges — so a question that spans results becomes one query. It is a derived view, not a new dataset: nothing here was collected for it.

What this is notThis graph contains no hospital / site, deployment, scanner (physical equipment), clinician and publication, because no such record exists in this repo. Those 5 node types are declared in the schema and rendered below with a count of exactly 0 — they are shown empty rather than hidden. There is also no graph database behind this page and no free-text search over it: the whole graph is 201 nodes in a JSON file, filtered in the browser.
§4

The one query that has to work

Show every model whose within-setting accuracy is above 0.85 but whose cross-setting retention is below 0.60 — the models that look good and travel badly.

The sharpest case in the suite: ResNet-18 (ImageNet) fine-tuned, trained and tested on the axial plane of the same abdominal CT volumes, reads them at 92.5% balanced accuracy. Move to the sagittal plane — same patients, same organs, same labels, different acquisition — and it reads them at 33.5%, retaining 29.2% of its skill. Across the zoo, mean retention runs from 97.4% for Random forest down to 36.1% for MLP (256) on raw pixels. The number everyone reports is not the number that decides whether the model works in a second hospital.

Show every model whose within-setting accuracy is above 0.85 but whose cross-setting retention is below 0.60 — the models that look good and travel badly.LOOKS GOOD, TRAVELS BADLY0.350.450.550.650.750.850.950.200.300.400.500.600.700.800.901.00Within-setting balanced accuracyMean cross-setting retentionLogistic regression trained on the test period 1 plane within-setting balanced accuracy 97.7% mean cross-setting retention 83.7% worst: 83.7% to test period 2 (90.0% balanced accuracy)MLP (128, 64) trained on the test period 1 plane within-setting balanced accuracy 97.6% mean cross-setting retention 79.0% worst: 79.0% to test period 2 (87.6% balanced accuracy)Random forest trained on the test period 2 plane within-setting balanced accuracy 97.5% mean cross-setting retention 94.8% worst: 94.8% to test period 1 (95.0% balanced accuracy)Random forest trained on the test period 1 plane within-setting balanced accuracy 95.0% mean cross-setting retention 100.0% worst: 100.0% to test period 2 (97.5% balanced accuracy)Gradient boosting trained on the test period 1 plane within-setting balanced accuracy 93.2% mean cross-setting retention 83.2% worst: 83.2% to test period 2 (85.9% balanced accuracy)ResNet-18 (ImageNet) fine-tuned trained on the coronal plane within-setting balanced accuracy 92.6% mean cross-setting retention 62.2% worst: 50.9% to sagittal (51.6% balanced accuracy)ResNet-18 (ImageNet) fine-tuned trained on the axial plane within-setting balanced accuracy 92.5% mean cross-setting retention 49.1% worst: 29.2% to sagittal (33.5% balanced accuracy)resnet18_ft · axialSmall CNN, trained from scratch trained on the axial plane within-setting balanced accuracy 92.3% mean cross-setting retention 57.7% worst: 37.4% to sagittal (40.2% balanced accuracy)cnn_scratch · axialSmall CNN, trained from scratch trained on the coronal plane within-setting balanced accuracy 90.9% mean cross-setting retention 60.4% worst: 50.0% to sagittal (50.0% balanced accuracy)Logistic regression trained on the test period 2 plane within-setting balanced accuracy 90.0% mean cross-setting retention 100.0% worst: 100.0% to test period 1 (97.7% balanced accuracy)MLP (128, 64) trained on the test period 2 plane within-setting balanced accuracy 87.6% mean cross-setting retention 100.0% worst: 100.0% to test period 1 (97.6% balanced accuracy)Gradient boosting trained on the test period 2 plane within-setting balanced accuracy 85.9% mean cross-setting retention 100.0% worst: 100.0% to test period 1 (93.2% balanced accuracy)ResNet-18 (ImageNet) frozen features + linear probe trained on the axial plane within-setting balanced accuracy 82.1% mean cross-setting retention 41.7% worst: 29.2% to sagittal (30.4% balanced accuracy)Random forest trained on the white (vinho verde) plane within-setting balanced accuracy 81.4% mean cross-setting retention 24.0% worst: 24.0% to red (vinho verde) (57.5% balanced accuracy)Random forest trained on the red (vinho verde) plane within-setting balanced accuracy 80.5% mean cross-setting retention 64.9% worst: 64.9% to white (vinho verde) (69.8% balanced accuracy)Gradient boosting trained on the red (vinho verde) plane within-setting balanced accuracy 80.3% mean cross-setting retention 69.7% worst: 69.7% to white (vinho verde) (71.1% balanced accuracy)Random forest on raw pixels trained on the coronal plane within-setting balanced accuracy 80.2% mean cross-setting retention 55.0% worst: 47.5% to sagittal (42.9% balanced accuracy)ResNet-18 (ImageNet) frozen features + linear probe trained on the coronal plane within-setting balanced accuracy 78.6% mean cross-setting retention 63.8% worst: 48.0% to sagittal (42.5% balanced accuracy)ResNet-18 (ImageNet) fine-tuned trained on the sagittal plane within-setting balanced accuracy 77.1% mean cross-setting retention 70.0% worst: 48.3% to axial (42.0% balanced accuracy)Random forest on raw pixels trained on the axial plane within-setting balanced accuracy 76.6% mean cross-setting retention 52.3% worst: 36.3% to sagittal (33.6% balanced accuracy)MLP (128, 64) trained on the red (vinho verde) plane within-setting balanced accuracy 76.0% mean cross-setting retention 88.7% worst: 88.7% to white (vinho verde) (73.1% balanced accuracy)Logistic regression trained on the red (vinho verde) plane within-setting balanced accuracy 75.2% mean cross-setting retention 77.4% worst: 77.4% to white (vinho verde) (69.5% balanced accuracy)Small CNN, trained from scratch trained on the sagittal plane within-setting balanced accuracy 75.0% mean cross-setting retention 71.6% worst: 52.4% to axial (43.6% balanced accuracy)Gradient boosting trained on the white (vinho verde) plane within-setting balanced accuracy 74.6% mean cross-setting retention 46.2% worst: 46.2% to red (vinho verde) (61.4% balanced accuracy)HOG + logistic regression trained on the coronal plane within-setting balanced accuracy 73.8% mean cross-setting retention 41.0% worst: 34.8% to sagittal (31.6% balanced accuracy)MLP (128, 64) trained on the white (vinho verde) plane within-setting balanced accuracy 72.8% mean cross-setting retention 29.8% worst: 29.8% to red (vinho verde) (56.8% balanced accuracy)MLP (256) on raw pixels trained on the coronal plane within-setting balanced accuracy 72.7% mean cross-setting retention 40.9% worst: 32.9% to sagittal (30.0% balanced accuracy)MLP (256) on raw pixels trained on the axial plane within-setting balanced accuracy 71.6% mean cross-setting retention 28.3% worst: 12.1% to sagittal (16.7% balanced accuracy)HOG + logistic regression trained on the axial plane within-setting balanced accuracy 69.2% mean cross-setting retention 38.2% worst: 17.2% to sagittal (19.4% balanced accuracy)Logistic regression trained on the white (vinho verde) plane within-setting balanced accuracy 69.1% mean cross-setting retention 73.3% worst: 73.3% to red (vinho verde) (64.0% balanced accuracy)PCA-64 + logistic regression trained on the coronal plane within-setting balanced accuracy 65.2% mean cross-setting retention 42.0% worst: 34.1% to sagittal (28.2% balanced accuracy)ResNet-18 (ImageNet) frozen features + linear probe trained on the sagittal plane within-setting balanced accuracy 64.2% mean cross-setting retention 69.3% worst: 64.0% to axial (44.4% balanced accuracy)Random forest on raw pixels trained on the sagittal plane within-setting balanced accuracy 61.5% mean cross-setting retention 61.2% worst: 42.3% to axial (31.3% balanced accuracy)PCA-64 + logistic regression trained on the axial plane within-setting balanced accuracy 59.7% mean cross-setting retention 29.8% worst: 11.9% to sagittal (15.1% balanced accuracy)MLP (256) on raw pixels trained on the sagittal plane within-setting balanced accuracy 54.9% mean cross-setting retention 39.2% worst: 21.3% to axial (18.9% balanced accuracy)HOG + logistic regression trained on the sagittal plane within-setting balanced accuracy 53.0% mean cross-setting retention 56.5% worst: 28.1% to axial (21.4% balanced accuracy)PCA-64 + logistic regression trained on the sagittal plane within-setting balanced accuracy 42.3% mean cross-setting retention 49.8% worst: 29.8% to axial (19.0% balanced accuracy)
in the quadrant (2 of 37)everything elseone point per (model, training acquisition setting) pairresults/cross_site/*.json
All 37 points as a table
ModelTrained onWithin-settingMean retentionWorst retentionWorst target
Logistic regressiontest period 197.7%83.7%83.7%test period 2 · 90.0% bal. acc.
MLP (128, 64)test period 197.6%79.0%79.0%test period 2 · 87.6% bal. acc.
Random foresttest period 297.5%94.8%94.8%test period 1 · 95.0% bal. acc.
Random foresttest period 195.0%100.0%100.0%test period 2 · 97.5% bal. acc.
Gradient boostingtest period 193.2%83.2%83.2%test period 2 · 85.9% bal. acc.
ResNet-18 (ImageNet) fine-tunedcoronal92.6%62.2%50.9%sagittal · 51.6% bal. acc.
ResNet-18 (ImageNet) fine-tunedaxial92.5%49.1%29.2%sagittal · 33.5% bal. acc.
Small CNN, trained from scratchaxial92.3%57.7%37.4%sagittal · 40.2% bal. acc.
Small CNN, trained from scratchcoronal90.9%60.4%50.0%sagittal · 50.0% bal. acc.
Logistic regressiontest period 290.0%100.0%100.0%test period 1 · 97.7% bal. acc.
MLP (128, 64)test period 287.6%100.0%100.0%test period 1 · 97.6% bal. acc.
Gradient boostingtest period 285.9%100.0%100.0%test period 1 · 93.2% bal. acc.
ResNet-18 (ImageNet) frozen features + linear probeaxial82.1%41.7%29.2%sagittal · 30.4% bal. acc.
Random forestwhite (vinho verde)81.4%24.0%24.0%red (vinho verde) · 57.5% bal. acc.
Random forestred (vinho verde)80.5%64.9%64.9%white (vinho verde) · 69.8% bal. acc.
Gradient boostingred (vinho verde)80.3%69.7%69.7%white (vinho verde) · 71.1% bal. acc.
Random forest on raw pixelscoronal80.2%55.0%47.5%sagittal · 42.9% bal. acc.
ResNet-18 (ImageNet) frozen features + linear probecoronal78.6%63.8%48.0%sagittal · 42.5% bal. acc.
ResNet-18 (ImageNet) fine-tunedsagittal77.1%70.0%48.3%axial · 42.0% bal. acc.
Random forest on raw pixelsaxial76.6%52.3%36.3%sagittal · 33.6% bal. acc.
MLP (128, 64)red (vinho verde)76.0%88.7%88.7%white (vinho verde) · 73.1% bal. acc.
Logistic regressionred (vinho verde)75.2%77.4%77.4%white (vinho verde) · 69.5% bal. acc.
Small CNN, trained from scratchsagittal75.0%71.6%52.4%axial · 43.6% bal. acc.
Gradient boostingwhite (vinho verde)74.6%46.2%46.2%red (vinho verde) · 61.4% bal. acc.
HOG + logistic regressioncoronal73.8%41.0%34.8%sagittal · 31.6% bal. acc.
MLP (128, 64)white (vinho verde)72.8%29.8%29.8%red (vinho verde) · 56.8% bal. acc.
MLP (256) on raw pixelscoronal72.7%40.9%32.9%sagittal · 30.0% bal. acc.
MLP (256) on raw pixelsaxial71.6%28.3%12.1%sagittal · 16.7% bal. acc.
HOG + logistic regressionaxial69.2%38.2%17.2%sagittal · 19.4% bal. acc.
Logistic regressionwhite (vinho verde)69.1%73.3%73.3%red (vinho verde) · 64.0% bal. acc.
PCA-64 + logistic regressioncoronal65.2%42.0%34.1%sagittal · 28.2% bal. acc.
ResNet-18 (ImageNet) frozen features + linear probesagittal64.2%69.3%64.0%axial · 44.4% bal. acc.
Random forest on raw pixelssagittal61.5%61.2%42.3%axial · 31.3% bal. acc.
PCA-64 + logistic regressionaxial59.7%29.8%11.9%sagittal · 15.1% bal. acc.
MLP (256) on raw pixelssagittal54.9%39.2%21.3%axial · 18.9% bal. acc.
HOG + logistic regressionsagittal53.0%56.5%28.1%axial · 21.4% bal. acc.
PCA-64 + logistic regressionsagittal42.3%49.8%29.8%axial · 19.0% bal. acc.
§2

What the graph can and cannot hold

Every node and edge type is declared, populated or not. The counts below are the same numbers the explorer filters on. Six node types and three edge types have nothing in them; that is the honest state of the record, and hiding them would be the dishonest way to draw this page.

201 nodes · 632 edges · projected from 216 evaluation records, 3 cross-site family, 100 ledger entries · code fingerprint 7ab31ab2d451, a158da61099e, b444c02112cc, b5b34c074f7f, dde8cf648b5e, de32bca72d56

  • 10 of 216 records carry no `domain` field (it is doc 05's addition), so their task is placed in `medicine` by the registry fallback rather than by the record itself. The remaining 206 declare their own domain and that value is used.
  • 44 of the 1524 rows on the FDA AI-Enabled Medical Device List are carried as `regulatory_approval` nodes (census: every AI-enabled device on the FDA list whose final decision date falls in 2026-03, the most recent calendar month the source file contains). They are the public record, not our measurements: each carries `attrs.source`, `attrs.source_url` and `attrs.retrieved_utc`. The name matcher ran over 1524 registry rows against 61 of our models and tasks. Its best score anywhere was 0.333, and no candidate at any score becomes an edge: only a submission number declared by the model owner does, and 0 records declare one. Every `approved_for` edge in this graph is therefore a self-asserted, checkable identifier — and there are none.
model:baseline_only_ancova —[benchmarked_on]→ task:procova_validitymodel:baseline_only_ancova_ad —[benchmarked_on]→ task:procova_validity_admodel:biomedbert_probe —[benchmarked_on]→ task:jobpost_fraudmodel:biomedbert_probe —[benchmarked_on]→ task:ledgarmodel:biomedbert_probe —[benchmarked_on]→ task:medabstractsmodel:biomedclip_ft —[benchmarked_on]→ task:breastmnist_224model:biomedclip_ft —[benchmarked_on]→ task:retinamnist_224model:biomedclip_probe —[benchmarked_on]→ task:bloodmnistmodel:biomedclip_probe —[benchmarked_on]→ task:bloodmnist_224model:biomedclip_probe —[benchmarked_on]→ task:breastmnistmodel:biomedclip_probe —[benchmarked_on]→ task:breastmnist_224model:biomedclip_probe —[benchmarked_on]→ task:dermamnistmodel:biomedclip_probe —[benchmarked_on]→ task:dermamnist_224model:biomedclip_probe —[benchmarked_on]→ task:organcmnistmodel:biomedclip_probe —[benchmarked_on]→ task:organcmnist_224model:biomedclip_probe —[benchmarked_on]→ task:pneumoniamnistmodel:biomedclip_probe —[benchmarked_on]→ task:pneumoniamnist_224model:biomedclip_probe —[benchmarked_on]→ task:retinamnistmodel:biomedclip_probe —[benchmarked_on]→ task:retinamnist_224model:biomedclip_zeroshot —[benchmarked_on]→ task:bloodmnistmodel:biomedclip_zeroshot —[benchmarked_on]→ task:bloodmnist_224model:biomedclip_zeroshot —[benchmarked_on]→ task:breastmnistmodel:biomedclip_zeroshot —[benchmarked_on]→ task:breastmnist_224model:biomedclip_zeroshot —[benchmarked_on]→ task:dermamnistmodel:biomedclip_zeroshot —[benchmarked_on]→ task:dermamnist_224model:biomedclip_zeroshot —[benchmarked_on]→ task:organcmnistmodel:biomedclip_zeroshot —[benchmarked_on]→ task:organcmnist_224model:biomedclip_zeroshot —[benchmarked_on]→ task:pneumoniamnistmodel:biomedclip_zeroshot —[benchmarked_on]→ task:pneumoniamnist_224model:biomedclip_zeroshot —[benchmarked_on]→ task:retinamnistmodel:biomedclip_zeroshot —[benchmarked_on]→ task:retinamnist_224model:cnn_scratch —[benchmarked_on]→ task:bloodmnistmodel:cnn_scratch —[benchmarked_on]→ task:breastmnistmodel:cnn_scratch —[benchmarked_on]→ task:dermamnistmodel:cnn_scratch —[benchmarked_on]→ task:octmnistmodel:cnn_scratch —[benchmarked_on]→ task:organamnistmodel:cnn_scratch —[benchmarked_on]→ task:organcmnistmodel:cnn_scratch —[benchmarked_on]→ task:organsmnistmodel:cnn_scratch —[benchmarked_on]→ task:pathmnistmodel:cnn_scratch —[benchmarked_on]→ task:pneumoniamnistmodel:cnn_scratch —[benchmarked_on]→ task:retinamnistmodel:cnn_scratch —[benchmarked_on]→ task:tissuemnistmodel:covariate_shopping_20 —[benchmarked_on]→ task:procova_validitymodel:covariate_shopping_20_ad —[benchmarked_on]→ task:procova_validity_admodel:dinov2_probe —[benchmarked_on]→ task:bloodmnistmodel:dinov2_probe —[benchmarked_on]→ task:bloodmnist_224model:dinov2_probe —[benchmarked_on]→ task:breastmnistmodel:dinov2_probe —[benchmarked_on]→ task:breastmnist_224model:dinov2_probe —[benchmarked_on]→ task:dermamnistmodel:dinov2_probe —[benchmarked_on]→ task:dermamnist_224model:dinov2_probe —[benchmarked_on]→ task:organcmnistmodel:dinov2_probe —[benchmarked_on]→ task:organcmnist_224model:dinov2_probe —[benchmarked_on]→ task:pneumoniamnistmodel:dinov2_probe —[benchmarked_on]→ task:pneumoniamnist_224model:dinov2_probe —[benchmarked_on]→ task:retinamnistmodel:dinov2_probe —[benchmarked_on]→ task:retinamnist_224model:gte_probe —[benchmarked_on]→ task:jobpost_fraudmodel:gte_probe —[benchmarked_on]→ task:ledgarmodel:gte_probe —[benchmarked_on]→ task:medabstractsmodel:hog_logreg —[benchmarked_on]→ task:bloodmnistmodel:hog_logreg —[benchmarked_on]→ task:breastmnistmodel:hog_logreg —[benchmarked_on]→ task:dermamnistmodel:hog_logreg —[benchmarked_on]→ task:octmnistmodel:hog_logreg —[benchmarked_on]→ task:organamnistmodel:hog_logreg —[benchmarked_on]→ task:organcmnistmodel:hog_logreg —[benchmarked_on]→ task:organsmnistmodel:hog_logreg —[benchmarked_on]→ task:pathmnistmodel:hog_logreg —[benchmarked_on]→ task:pneumoniamnistmodel:hog_logreg —[benchmarked_on]→ task:retinamnistmodel:hog_logreg —[benchmarked_on]→ task:tissuemnistmodel:mlp_pixels —[benchmarked_on]→ task:bloodmnistmodel:mlp_pixels —[benchmarked_on]→ task:breastmnistmodel:mlp_pixels —[benchmarked_on]→ task:dermamnistmodel:mlp_pixels —[benchmarked_on]→ task:octmnistmodel:mlp_pixels —[benchmarked_on]→ task:organamnistmodel:mlp_pixels —[benchmarked_on]→ task:organcmnistmodel:mlp_pixels —[benchmarked_on]→ task:organsmnistmodel:mlp_pixels —[benchmarked_on]→ task:pathmnistmodel:mlp_pixels —[benchmarked_on]→ task:pneumoniamnistmodel:mlp_pixels —[benchmarked_on]→ task:retinamnistmodel:mlp_pixels —[benchmarked_on]→ task:tissuemnistmodel:pca_logreg —[benchmarked_on]→ task:bloodmnistmodel:pca_logreg —[benchmarked_on]→ task:breastmnistmodel:pca_logreg —[benchmarked_on]→ task:dermamnistmodel:pca_logreg —[benchmarked_on]→ task:octmnistmodel:pca_logreg —[benchmarked_on]→ task:organamnistmodel:pca_logreg —[benchmarked_on]→ task:organcmnistmodel:pca_logreg —[benchmarked_on]→ task:organsmnistmodel:pca_logreg —[benchmarked_on]→ task:pathmnistmodel:pca_logreg —[benchmarked_on]→ task:pneumoniamnistmodel:pca_logreg —[benchmarked_on]→ task:retinamnistmodel:pca_logreg —[benchmarked_on]→ task:tissuemnistmodel:pubmedbert_st_probe —[benchmarked_on]→ task:jobpost_fraudmodel:pubmedbert_st_probe —[benchmarked_on]→ task:ledgarmodel:pubmedbert_st_probe —[benchmarked_on]→ task:medabstractsmodel:resnet18_ft —[benchmarked_on]→ task:bloodmnistmodel:resnet18_ft —[benchmarked_on]→ task:breastmnistmodel:resnet18_ft —[benchmarked_on]→ task:dermamnistmodel:resnet18_ft —[benchmarked_on]→ task:octmnistmodel:resnet18_ft —[benchmarked_on]→ task:organamnistmodel:resnet18_ft —[benchmarked_on]→ task:organcmnistmodel:resnet18_ft —[benchmarked_on]→ task:organsmnistmodel:resnet18_ft —[benchmarked_on]→ task:pathmnistmodel:resnet18_ft —[benchmarked_on]→ task:pneumoniamnistmodel:resnet18_ft —[benchmarked_on]→ task:retinamnistmodel:resnet18_ft —[benchmarked_on]→ task:tissuemnistmodel:resnet18_in_probe —[benchmarked_on]→ task:bloodmnistmodel:resnet18_in_probe —[benchmarked_on]→ task:breastmnistmodel:resnet18_in_probe —[benchmarked_on]→ task:dermamnistmodel:resnet18_in_probe —[benchmarked_on]→ task:octmnistmodel:resnet18_in_probe —[benchmarked_on]→ task:organamnistmodel:resnet18_in_probe —[benchmarked_on]→ task:organcmnistmodel:resnet18_in_probe —[benchmarked_on]→ task:organsmnistmodel:resnet18_in_probe —[benchmarked_on]→ task:pathmnistmodel:resnet18_in_probe —[benchmarked_on]→ task:pneumoniamnistmodel:resnet18_in_probe —[benchmarked_on]→ task:retinamnistmodel:resnet18_in_probe —[benchmarked_on]→ task:tissuemnistmodel:rf_pixels —[benchmarked_on]→ task:bloodmnistmodel:rf_pixels —[benchmarked_on]→ task:breastmnistmodel:rf_pixels —[benchmarked_on]→ task:dermamnistmodel:rf_pixels —[benchmarked_on]→ task:octmnistmodel:rf_pixels —[benchmarked_on]→ task:organamnistmodel:rf_pixels —[benchmarked_on]→ task:organcmnistmodel:rf_pixels —[benchmarked_on]→ task:organsmnistmodel:rf_pixels —[benchmarked_on]→ task:pathmnistmodel:rf_pixels —[benchmarked_on]→ task:pneumoniamnistmodel:rf_pixels —[benchmarked_on]→ task:retinamnistmodel:rf_pixels —[benchmarked_on]→ task:tissuemnistmodel:tab_gbm —[benchmarked_on]→ task:adult_incomemodel:tab_gbm —[benchmarked_on]→ task:anuran_mfccmodel:tab_gbm —[benchmarked_on]→ task:breast_wdbcmodel:tab_gbm —[benchmarked_on]→ task:coil2000_caravanmodel:tab_gbm —[benchmarked_on]→ task:diabetes_pimamodel:tab_gbm —[benchmarked_on]→ task:dry_beanmodel:tab_gbm —[benchmarked_on]→ task:german_creditmodel:tab_gbm —[benchmarked_on]→ task:heart_clevelandmodel:tab_gbm —[benchmarked_on]→ task:landsat_statlogmodel:tab_gbm —[benchmarked_on]→ task:occupancy_detectionmodel:tab_gbm —[benchmarked_on]→ task:occupancy_detection_2model:tab_gbm —[benchmarked_on]→ task:secommodel:tab_gbm —[benchmarked_on]→ task:steel_plate_faultsmodel:tab_gbm —[benchmarked_on]→ task:wine_quality_redmodel:tab_gbm —[benchmarked_on]→ task:wine_quality_whitemodel:tab_logreg —[benchmarked_on]→ task:adult_incomemodel:tab_logreg —[benchmarked_on]→ task:anuran_mfccmodel:tab_logreg —[benchmarked_on]→ task:breast_wdbcmodel:tab_logreg —[benchmarked_on]→ task:coil2000_caravanmodel:tab_logreg —[benchmarked_on]→ task:diabetes_pimamodel:tab_logreg —[benchmarked_on]→ task:dry_beanmodel:tab_logreg —[benchmarked_on]→ task:german_creditmodel:tab_logreg —[benchmarked_on]→ task:heart_clevelandmodel:tab_logreg —[benchmarked_on]→ task:landsat_statlogmodel:tab_logreg —[benchmarked_on]→ task:occupancy_detectionmodel:tab_logreg —[benchmarked_on]→ task:occupancy_detection_2model:tab_logreg —[benchmarked_on]→ task:secommodel:tab_logreg —[benchmarked_on]→ task:steel_plate_faultsmodel:tab_logreg —[benchmarked_on]→ task:wine_quality_redmodel:tab_logreg —[benchmarked_on]→ task:wine_quality_whitemodel:tab_mlp —[benchmarked_on]→ task:adult_incomemodel:tab_mlp —[benchmarked_on]→ task:anuran_mfccmodel:tab_mlp —[benchmarked_on]→ task:breast_wdbcmodel:tab_mlp —[benchmarked_on]→ task:coil2000_caravanmodel:tab_mlp —[benchmarked_on]→ task:diabetes_pimamodel:tab_mlp —[benchmarked_on]→ task:dry_beanmodel:tab_mlp —[benchmarked_on]→ task:german_creditmodel:tab_mlp —[benchmarked_on]→ task:heart_clevelandmodel:tab_mlp —[benchmarked_on]→ task:landsat_statlogmodel:tab_mlp —[benchmarked_on]→ task:occupancy_detectionmodel:tab_mlp —[benchmarked_on]→ task:occupancy_detection_2model:tab_mlp —[benchmarked_on]→ task:secommodel:tab_mlp —[benchmarked_on]→ task:steel_plate_faultsmodel:tab_mlp —[benchmarked_on]→ task:wine_quality_redmodel:tab_mlp —[benchmarked_on]→ task:wine_quality_whitemodel:tab_rf —[benchmarked_on]→ task:adult_incomemodel:tab_rf —[benchmarked_on]→ task:anuran_mfccmodel:tab_rf —[benchmarked_on]→ task:breast_wdbcmodel:tab_rf —[benchmarked_on]→ task:coil2000_caravanmodel:tab_rf —[benchmarked_on]→ task:diabetes_pimamodel:tab_rf —[benchmarked_on]→ task:dry_beanmodel:tab_rf —[benchmarked_on]→ task:german_creditmodel:tab_rf —[benchmarked_on]→ task:heart_clevelandmodel:tab_rf —[benchmarked_on]→ task:landsat_statlogmodel:tab_rf —[benchmarked_on]→ task:occupancy_detectionmodel:tab_rf —[benchmarked_on]→ task:occupancy_detection_2model:tab_rf —[benchmarked_on]→ task:secommodel:tab_rf —[benchmarked_on]→ task:steel_plate_faultsmodel:tab_rf —[benchmarked_on]→ task:wine_quality_redmodel:tab_rf —[benchmarked_on]→ task:wine_quality_whitemodel:tfidf_logreg —[benchmarked_on]→ task:jobpost_fraudmodel:tfidf_logreg —[benchmarked_on]→ task:ledgarmodel:tfidf_logreg —[benchmarked_on]→ task:medabstractsmodel:tfidf_mlp —[benchmarked_on]→ task:jobpost_fraudmodel:tfidf_mlp —[benchmarked_on]→ task:ledgarmodel:tfidf_mlp —[benchmarked_on]→ task:medabstractsmodel:tfidf_nb —[benchmarked_on]→ task:jobpost_fraudmodel:tfidf_nb —[benchmarked_on]→ task:ledgarmodel:tfidf_nb —[benchmarked_on]→ task:medabstractsmodel:tfidf_svm —[benchmarked_on]→ task:jobpost_fraudmodel:tfidf_svm —[benchmarked_on]→ task:ledgarmodel:tfidf_svm —[benchmarked_on]→ task:medabstractsmodel:twin_broken_anticorrelated —[benchmarked_on]→ task:procova_validitymodel:twin_broken_anticorrelated_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_broken_nonmonotone —[benchmarked_on]→ task:procova_validitymodel:twin_broken_nonmonotone_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_constant —[benchmarked_on]→ task:procova_validitymodel:twin_constant_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_r2_0.40 —[benchmarked_on]→ task:procova_validitymodel:twin_r2_0.40_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_r2_0.60 —[benchmarked_on]→ task:procova_validitymodel:twin_r2_0.60_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_r2_0.80 —[benchmarked_on]→ task:procova_validitymodel:twin_r2_0.80_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_useless_r2_0.0 —[benchmarked_on]→ task:procova_validitymodel:twin_useless_r2_0.0_ad —[benchmarked_on]→ task:procova_validity_admodel:twin_wrong_population_age —[benchmarked_on]→ task:procova_validitymodel:twin_wrong_population_age_ad —[benchmarked_on]→ task:procova_validity_admodel:baseline_only_ancova —[compared_with]→ model:covariate_shopping_20model:baseline_only_ancova —[compared_with]→ model:twin_broken_anticorrelatedmodel:baseline_only_ancova —[compared_with]→ model:twin_broken_nonmonotonemodel:baseline_only_ancova —[compared_with]→ model:twin_constantmodel:baseline_only_ancova —[compared_with]→ model:twin_r2_0.40model:baseline_only_ancova —[compared_with]→ model:twin_r2_0.60model:baseline_only_ancova —[compared_with]→ model:twin_r2_0.80model:baseline_only_ancova —[compared_with]→ model:twin_useless_r2_0.0model:baseline_only_ancova —[compared_with]→ model:twin_wrong_population_agemodel:baseline_only_ancova_ad —[compared_with]→ model:covariate_shopping_20_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_broken_anticorrelated_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_broken_nonmonotone_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_constant_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_r2_0.40_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_r2_0.60_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_r2_0.80_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:baseline_only_ancova_ad —[compared_with]→ model:twin_wrong_population_age_admodel:biomedbert_probe —[compared_with]→ model:gte_probemodel:biomedbert_probe —[compared_with]→ model:pubmedbert_st_probemodel:biomedbert_probe —[compared_with]→ model:tfidf_logregmodel:biomedbert_probe —[compared_with]→ model:tfidf_mlpmodel:biomedbert_probe —[compared_with]→ model:tfidf_nbmodel:biomedbert_probe —[compared_with]→ model:tfidf_svmmodel:biomedclip_ft —[compared_with]→ model:biomedclip_probemodel:biomedclip_ft —[compared_with]→ model:biomedclip_zeroshotmodel:biomedclip_ft —[compared_with]→ model:dinov2_probemodel:biomedclip_probe —[compared_with]→ model:biomedclip_zeroshotmodel:biomedclip_probe —[compared_with]→ model:cnn_scratchmodel:biomedclip_probe —[compared_with]→ model:dinov2_probemodel:biomedclip_probe —[compared_with]→ model:hog_logregmodel:biomedclip_probe —[compared_with]→ model:mlp_pixelsmodel:biomedclip_probe —[compared_with]→ model:pca_logregmodel:biomedclip_probe —[compared_with]→ model:resnet18_ftmodel:biomedclip_probe —[compared_with]→ model:resnet18_in_probemodel:biomedclip_probe —[compared_with]→ model:rf_pixelsmodel:biomedclip_zeroshot —[compared_with]→ model:cnn_scratchmodel:biomedclip_zeroshot —[compared_with]→ model:dinov2_probemodel:biomedclip_zeroshot —[compared_with]→ model:hog_logregmodel:biomedclip_zeroshot —[compared_with]→ model:mlp_pixelsmodel:biomedclip_zeroshot —[compared_with]→ model:pca_logregmodel:biomedclip_zeroshot —[compared_with]→ model:resnet18_ftmodel:biomedclip_zeroshot —[compared_with]→ model:resnet18_in_probemodel:biomedclip_zeroshot —[compared_with]→ model:rf_pixelsmodel:cnn_scratch —[compared_with]→ model:dinov2_probemodel:cnn_scratch —[compared_with]→ model:hog_logregmodel:cnn_scratch —[compared_with]→ model:mlp_pixelsmodel:cnn_scratch —[compared_with]→ model:pca_logregmodel:cnn_scratch —[compared_with]→ model:resnet18_ftmodel:cnn_scratch —[compared_with]→ model:resnet18_in_probemodel:cnn_scratch —[compared_with]→ model:rf_pixelsmodel:covariate_shopping_20 —[compared_with]→ model:twin_broken_anticorrelatedmodel:covariate_shopping_20 —[compared_with]→ model:twin_broken_nonmonotonemodel:covariate_shopping_20 —[compared_with]→ model:twin_constantmodel:covariate_shopping_20 —[compared_with]→ model:twin_r2_0.40model:covariate_shopping_20 —[compared_with]→ model:twin_r2_0.60model:covariate_shopping_20 —[compared_with]→ model:twin_r2_0.80model:covariate_shopping_20 —[compared_with]→ model:twin_useless_r2_0.0model:covariate_shopping_20 —[compared_with]→ model:twin_wrong_population_agemodel:covariate_shopping_20_ad —[compared_with]→ model:twin_broken_anticorrelated_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_broken_nonmonotone_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_constant_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_r2_0.40_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_r2_0.60_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_r2_0.80_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:covariate_shopping_20_ad —[compared_with]→ model:twin_wrong_population_age_admodel:dinov2_probe —[compared_with]→ model:hog_logregmodel:dinov2_probe —[compared_with]→ model:mlp_pixelsmodel:dinov2_probe —[compared_with]→ model:pca_logregmodel:dinov2_probe —[compared_with]→ model:resnet18_ftmodel:dinov2_probe —[compared_with]→ model:resnet18_in_probemodel:dinov2_probe —[compared_with]→ model:rf_pixelsmodel:gte_probe —[compared_with]→ model:pubmedbert_st_probemodel:gte_probe —[compared_with]→ model:tfidf_logregmodel:gte_probe —[compared_with]→ model:tfidf_mlpmodel:gte_probe —[compared_with]→ model:tfidf_nbmodel:gte_probe —[compared_with]→ model:tfidf_svmmodel:hog_logreg —[compared_with]→ model:mlp_pixelsmodel:hog_logreg —[compared_with]→ model:pca_logregmodel:hog_logreg —[compared_with]→ model:resnet18_ftmodel:hog_logreg —[compared_with]→ model:resnet18_in_probemodel:hog_logreg —[compared_with]→ model:rf_pixelsmodel:mlp_pixels —[compared_with]→ model:pca_logregmodel:mlp_pixels —[compared_with]→ model:resnet18_ftmodel:mlp_pixels —[compared_with]→ model:resnet18_in_probemodel:mlp_pixels —[compared_with]→ model:rf_pixelsmodel:pca_logreg —[compared_with]→ model:resnet18_ftmodel:pca_logreg —[compared_with]→ model:resnet18_in_probemodel:pca_logreg —[compared_with]→ model:rf_pixelsmodel:pubmedbert_st_probe —[compared_with]→ model:tfidf_logregmodel:pubmedbert_st_probe —[compared_with]→ model:tfidf_mlpmodel:pubmedbert_st_probe —[compared_with]→ model:tfidf_nbmodel:pubmedbert_st_probe —[compared_with]→ model:tfidf_svmmodel:resnet18_ft —[compared_with]→ model:resnet18_in_probemodel:resnet18_ft —[compared_with]→ model:rf_pixelsmodel:resnet18_in_probe —[compared_with]→ model:rf_pixelsmodel:tab_gbm —[compared_with]→ model:tab_logregmodel:tab_gbm —[compared_with]→ model:tab_mlpmodel:tab_gbm —[compared_with]→ model:tab_rfmodel:tab_logreg —[compared_with]→ model:tab_mlpmodel:tab_logreg —[compared_with]→ model:tab_rfmodel:tab_mlp —[compared_with]→ model:tab_rfmodel:tfidf_logreg —[compared_with]→ model:tfidf_mlpmodel:tfidf_logreg —[compared_with]→ model:tfidf_nbmodel:tfidf_logreg —[compared_with]→ model:tfidf_svmmodel:tfidf_mlp —[compared_with]→ model:tfidf_nbmodel:tfidf_mlp —[compared_with]→ model:tfidf_svmmodel:tfidf_nb —[compared_with]→ model:tfidf_svmmodel:twin_broken_anticorrelated —[compared_with]→ model:twin_broken_nonmonotonemodel:twin_broken_anticorrelated —[compared_with]→ model:twin_constantmodel:twin_broken_anticorrelated —[compared_with]→ model:twin_r2_0.40model:twin_broken_anticorrelated —[compared_with]→ model:twin_r2_0.60model:twin_broken_anticorrelated —[compared_with]→ model:twin_r2_0.80model:twin_broken_anticorrelated —[compared_with]→ model:twin_useless_r2_0.0model:twin_broken_anticorrelated —[compared_with]→ model:twin_wrong_population_agemodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_broken_nonmonotone_admodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_constant_admodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_r2_0.40_admodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_r2_0.60_admodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_r2_0.80_admodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:twin_broken_anticorrelated_ad —[compared_with]→ model:twin_wrong_population_age_admodel:twin_broken_nonmonotone —[compared_with]→ model:twin_constantmodel:twin_broken_nonmonotone —[compared_with]→ model:twin_r2_0.40model:twin_broken_nonmonotone —[compared_with]→ model:twin_r2_0.60model:twin_broken_nonmonotone —[compared_with]→ model:twin_r2_0.80model:twin_broken_nonmonotone —[compared_with]→ model:twin_useless_r2_0.0model:twin_broken_nonmonotone —[compared_with]→ model:twin_wrong_population_agemodel:twin_broken_nonmonotone_ad —[compared_with]→ model:twin_constant_admodel:twin_broken_nonmonotone_ad —[compared_with]→ model:twin_r2_0.40_admodel:twin_broken_nonmonotone_ad —[compared_with]→ model:twin_r2_0.60_admodel:twin_broken_nonmonotone_ad —[compared_with]→ model:twin_r2_0.80_admodel:twin_broken_nonmonotone_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:twin_broken_nonmonotone_ad —[compared_with]→ model:twin_wrong_population_age_admodel:twin_constant —[compared_with]→ model:twin_r2_0.40model:twin_constant —[compared_with]→ model:twin_r2_0.60model:twin_constant —[compared_with]→ model:twin_r2_0.80model:twin_constant —[compared_with]→ model:twin_useless_r2_0.0model:twin_constant —[compared_with]→ model:twin_wrong_population_agemodel:twin_constant_ad —[compared_with]→ model:twin_r2_0.40_admodel:twin_constant_ad —[compared_with]→ model:twin_r2_0.60_admodel:twin_constant_ad —[compared_with]→ model:twin_r2_0.80_admodel:twin_constant_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:twin_constant_ad —[compared_with]→ model:twin_wrong_population_age_admodel:twin_r2_0.40 —[compared_with]→ model:twin_r2_0.60model:twin_r2_0.40 —[compared_with]→ model:twin_r2_0.80model:twin_r2_0.40 —[compared_with]→ model:twin_useless_r2_0.0model:twin_r2_0.40 —[compared_with]→ model:twin_wrong_population_agemodel:twin_r2_0.40_ad —[compared_with]→ model:twin_r2_0.60_admodel:twin_r2_0.40_ad —[compared_with]→ model:twin_r2_0.80_admodel:twin_r2_0.40_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:twin_r2_0.40_ad —[compared_with]→ model:twin_wrong_population_age_admodel:twin_r2_0.60 —[compared_with]→ model:twin_r2_0.80model:twin_r2_0.60 —[compared_with]→ model:twin_useless_r2_0.0model:twin_r2_0.60 —[compared_with]→ model:twin_wrong_population_agemodel:twin_r2_0.60_ad —[compared_with]→ model:twin_r2_0.80_admodel:twin_r2_0.60_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:twin_r2_0.60_ad —[compared_with]→ model:twin_wrong_population_age_admodel:twin_r2_0.80 —[compared_with]→ model:twin_useless_r2_0.0model:twin_r2_0.80 —[compared_with]→ model:twin_wrong_population_agemodel:twin_r2_0.80_ad —[compared_with]→ model:twin_useless_r2_0.0_admodel:twin_r2_0.80_ad —[compared_with]→ model:twin_wrong_population_age_admodel:twin_useless_r2_0.0 —[compared_with]→ model:twin_wrong_population_agemodel:twin_useless_r2_0.0_ad —[compared_with]→ model:twin_wrong_population_age_admodel:rf_pixels —[contaminated_by]→ generation:gen1generation:anchor —[drawn_from]→ dataset:Barcelona blood cell datasetgeneration:gen1 —[drawn_from]→ dataset:Barcelona blood cell datasetgeneration:gen2 —[drawn_from]→ dataset:Barcelona blood cell datasetgeneration:public —[drawn_from]→ dataset:Barcelona blood cell datasetmodel:baseline_only_ancova —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:baseline_only_ancova —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:baseline_only_ancova_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:baseline_only_ancova_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:biomedbert_probe —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:biomedbert_probe —[evaluated_under]→ code_fingerprint:b5b34c074f7fmodel:biomedbert_probe —[evaluated_under]→ spec_version:MedEval-1 v0.1model:biomedclip_ft —[evaluated_under]→ code_fingerprint:dde8cf648b5emodel:biomedclip_ft —[evaluated_under]→ spec_version:MedEval-1 v0.1model:biomedclip_probe —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:biomedclip_probe —[evaluated_under]→ spec_version:MedEval-1 v0.1model:biomedclip_zeroshot —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:biomedclip_zeroshot —[evaluated_under]→ spec_version:MedEval-1 v0.1model:cnn_scratch —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:cnn_scratch —[evaluated_under]→ spec_version:MedEval-1 v0.1model:covariate_shopping_20 —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:covariate_shopping_20 —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:covariate_shopping_20_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:covariate_shopping_20_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:dinov2_probe —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:dinov2_probe —[evaluated_under]→ spec_version:MedEval-1 v0.1model:gte_probe —[evaluated_under]→ code_fingerprint:b5b34c074f7fmodel:gte_probe —[evaluated_under]→ spec_version:MedEval-1 v0.1model:hog_logreg —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:hog_logreg —[evaluated_under]→ spec_version:MedEval-1 v0.1model:mlp_pixels —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:mlp_pixels —[evaluated_under]→ spec_version:MedEval-1 v0.1model:pca_logreg —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:pca_logreg —[evaluated_under]→ spec_version:MedEval-1 v0.1model:pubmedbert_st_probe —[evaluated_under]→ code_fingerprint:b5b34c074f7fmodel:pubmedbert_st_probe —[evaluated_under]→ spec_version:MedEval-1 v0.1model:resnet18_ft —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:resnet18_ft —[evaluated_under]→ spec_version:MedEval-1 v0.1model:resnet18_in_probe —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:resnet18_in_probe —[evaluated_under]→ spec_version:MedEval-1 v0.1model:rf_pixels —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:rf_pixels —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tab_gbm —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tab_gbm —[evaluated_under]→ code_fingerprint:de32bca72d56model:tab_gbm —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tab_logreg —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tab_logreg —[evaluated_under]→ code_fingerprint:de32bca72d56model:tab_logreg —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tab_mlp —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tab_mlp —[evaluated_under]→ code_fingerprint:de32bca72d56model:tab_mlp —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tab_rf —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tab_rf —[evaluated_under]→ code_fingerprint:de32bca72d56model:tab_rf —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tfidf_logreg —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tfidf_logreg —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tfidf_mlp —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tfidf_mlp —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tfidf_nb —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tfidf_nb —[evaluated_under]→ spec_version:MedEval-1 v0.1model:tfidf_svm —[evaluated_under]→ code_fingerprint:b444c02112ccmodel:tfidf_svm —[evaluated_under]→ spec_version:MedEval-1 v0.1model:twin_broken_anticorrelated —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_broken_anticorrelated —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_broken_anticorrelated_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_broken_anticorrelated_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_broken_nonmonotone —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_broken_nonmonotone —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_broken_nonmonotone_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_broken_nonmonotone_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_constant —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_constant —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_constant_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_constant_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_r2_0.40 —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_r2_0.40 —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_r2_0.40_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_r2_0.40_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_r2_0.60 —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_r2_0.60 —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_r2_0.60_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_r2_0.60_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_r2_0.80 —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_r2_0.80 —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_r2_0.80_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_r2_0.80_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_useless_r2_0.0 —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_useless_r2_0.0 —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_useless_r2_0.0_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_useless_r2_0.0_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_wrong_population_age —[evaluated_under]→ code_fingerprint:7ab31ab2d451model:twin_wrong_population_age —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:twin_wrong_population_age_ad —[evaluated_under]→ code_fingerprint:a158da61099emodel:twin_wrong_population_age_ad —[evaluated_under]→ spec_version:MedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft)model:covariate_shopping_20 —[failed_on]→ task:procova_validitymodel:covariate_shopping_20_ad —[failed_on]→ task:procova_validity_adtask:adult_income —[has_modality]→ modality:Tabular / socioeconomictask:anuran_mfcc —[has_modality]→ modality:Bioacoustic / MFCCtask:bloodmnist —[has_modality]→ modality:Microscopytask:bloodmnist_224 —[has_modality]→ modality:Microscopytask:breast_wdbc —[has_modality]→ modality:Tabular / imaging-derivedtask:breastmnist —[has_modality]→ modality:Ultrasoundtask:breastmnist_224 —[has_modality]→ modality:Ultrasoundtask:coil2000_caravan —[has_modality]→ modality:Tabular / insurancetask:dermamnist —[has_modality]→ modality:Dermatoscopytask:dermamnist_224 —[has_modality]→ modality:Dermatoscopytask:diabetes_pima —[has_modality]→ modality:Tabular / clinicaltask:dry_bean —[has_modality]→ modality:Tabular / imaging-derivedtask:german_credit —[has_modality]→ modality:Tabular / financialtask:heart_cleveland —[has_modality]→ modality:Tabular / clinicaltask:jobpost_fraud —[has_modality]→ modality:Recruitment texttask:landsat_statlog —[has_modality]→ modality:Tabular / multispectraltask:ledgar —[has_modality]→ modality:Legal texttask:medabstracts —[has_modality]→ modality:Clinical texttask:occupancy_detection —[has_modality]→ modality:Tabular / environmental sensorstask:occupancy_detection_2 —[has_modality]→ modality:Tabular / environmental sensorstask:octmnist —[has_modality]→ modality:OCTtask:organamnist —[has_modality]→ modality:CTtask:organcmnist —[has_modality]→ modality:CTtask:organcmnist_224 —[has_modality]→ modality:CTtask:organsmnist —[has_modality]→ modality:CTtask:pathmnist —[has_modality]→ modality:Histopathologytask:pneumoniamnist —[has_modality]→ modality:Chest X-raytask:pneumoniamnist_224 —[has_modality]→ modality:Chest X-raytask:procova_validity —[has_modality]→ modality:Prognostic model / clinical trialtask:procova_validity_ad —[has_modality]→ modality:Prognostic model / clinical trialtask:retinamnist —[has_modality]→ modality:Fundustask:retinamnist_224 —[has_modality]→ modality:Fundustask:secom —[has_modality]→ modality:Tabular / process sensorstask:steel_plate_faults —[has_modality]→ modality:Tabular / imaging-derivedtask:tissuemnist —[has_modality]→ modality:Microscopytask:wine_quality_red —[has_modality]→ modality:Tabular / physicochemicaltask:wine_quality_white —[has_modality]→ modality:Tabular / physicochemicaltask:adult_income —[in_domain]→ domain:labourtask:anuran_mfcc —[in_domain]→ domain:ecologytask:bloodmnist —[in_domain]→ domain:medicinetask:bloodmnist_224 —[in_domain]→ domain:medicinetask:breast_wdbc —[in_domain]→ domain:medicinetask:breastmnist —[in_domain]→ domain:medicinetask:breastmnist_224 —[in_domain]→ domain:medicinetask:coil2000_caravan —[in_domain]→ domain:financialtask:dermamnist —[in_domain]→ domain:medicinetask:dermamnist_224 —[in_domain]→ domain:medicinetask:diabetes_pima —[in_domain]→ domain:medicinetask:dry_bean —[in_domain]→ domain:agriculturetask:german_credit —[in_domain]→ domain:financialtask:heart_cleveland —[in_domain]→ domain:medicinetask:jobpost_fraud —[in_domain]→ domain:labourtask:landsat_statlog —[in_domain]→ domain:earthtask:ledgar —[in_domain]→ domain:legaltask:medabstracts —[in_domain]→ domain:medicinetask:occupancy_detection —[in_domain]→ domain:energytask:occupancy_detection_2 —[in_domain]→ domain:energytask:octmnist —[in_domain]→ domain:medicinetask:organamnist —[in_domain]→ domain:medicinetask:organcmnist —[in_domain]→ domain:medicinetask:organcmnist_224 —[in_domain]→ domain:medicinetask:organsmnist —[in_domain]→ domain:medicinetask:pathmnist —[in_domain]→ domain:medicinetask:pneumoniamnist —[in_domain]→ domain:medicinetask:pneumoniamnist_224 —[in_domain]→ domain:medicinetask:procova_validity —[in_domain]→ domain:medicinetask:procova_validity_ad —[in_domain]→ domain:alzheimers/cdr-sbtask:retinamnist —[in_domain]→ domain:medicinetask:retinamnist_224 —[in_domain]→ domain:medicinetask:secom —[in_domain]→ domain:industrialtask:steel_plate_faults —[in_domain]→ domain:industrialtask:tissuemnist —[in_domain]→ domain:medicinetask:wine_quality_red —[in_domain]→ domain:agriculturetask:wine_quality_white —[in_domain]→ domain:agriculturetask:occupancy_detection —[measured_in_setting]→ acquisition_setting:test period 1task:occupancy_detection_2 —[measured_in_setting]→ acquisition_setting:test period 2task:organamnist —[measured_in_setting]→ acquisition_setting:axialtask:organcmnist —[measured_in_setting]→ acquisition_setting:coronaltask:organsmnist —[measured_in_setting]→ acquisition_setting:sagittaltask:wine_quality_red —[measured_in_setting]→ acquisition_setting:red (vinho verde)task:wine_quality_white —[measured_in_setting]→ acquisition_setting:white (vinho verde)generation:gen1 —[retired_by]→ generation:gen2model:hog_logreg —[scored_on]→ generation:gen1model:hog_logreg —[scored_on]→ generation:gen2model:hog_logreg —[scored_on]→ generation:publicmodel:mlp_pixels —[scored_on]→ generation:gen1model:mlp_pixels —[scored_on]→ generation:gen2model:mlp_pixels —[scored_on]→ generation:publicmodel:pca_logreg —[scored_on]→ generation:gen1model:pca_logreg —[scored_on]→ generation:gen2model:pca_logreg —[scored_on]→ generation:publicmodel:resnet18_in_probe —[scored_on]→ generation:gen1model:resnet18_in_probe —[scored_on]→ generation:gen2model:resnet18_in_probe —[scored_on]→ generation:publicmodel:rf_pixels —[scored_on]→ generation:gen1model:rf_pixels —[scored_on]→ generation:gen2model:rf_pixels —[scored_on]→ generation:publictask:bloodmnist —[shares_dataset]→ task:bloodmnist_224task:breastmnist —[shares_dataset]→ task:breastmnist_224task:dermamnist —[shares_dataset]→ task:dermamnist_224task:occupancy_detection —[shares_dataset]→ task:occupancy_detection_2task:organamnist —[shares_dataset]→ task:organcmnisttask:organamnist —[shares_dataset]→ task:organcmnist_224task:organamnist —[shares_dataset]→ task:organsmnisttask:organcmnist —[shares_dataset]→ task:organcmnist_224task:organcmnist —[shares_dataset]→ task:organsmnisttask:organcmnist_224 —[shares_dataset]→ task:organsmnisttask:pneumoniamnist —[shares_dataset]→ task:pneumoniamnist_224task:retinamnist —[shares_dataset]→ task:retinamnist_224task:wine_quality_red —[shares_dataset]→ task:wine_quality_whiteacquisition_setting:axial —[transfers_to]→ acquisition_setting:coronalacquisition_setting:axial —[transfers_to]→ acquisition_setting:sagittalacquisition_setting:coronal —[transfers_to]→ acquisition_setting:axialacquisition_setting:coronal —[transfers_to]→ acquisition_setting:sagittalacquisition_setting:red (vinho verde) —[transfers_to]→ acquisition_setting:white (vinho verde)acquisition_setting:sagittal —[transfers_to]→ acquisition_setting:axialacquisition_setting:sagittal —[transfers_to]→ acquisition_setting:coronalacquisition_setting:test period 1 —[transfers_to]→ acquisition_setting:test period 2acquisition_setting:test period 2 —[transfers_to]→ acquisition_setting:test period 1acquisition_setting:white (vinho verde) —[transfers_to]→ acquisition_setting:red (vinho verde)task:adult_income —[uses_dataset]→ dataset:UCI Adult / Census Incometask:anuran_mfcc —[uses_dataset]→ dataset:UCI Anuran Calls (MFCCs)task:bloodmnist —[uses_dataset]→ dataset:Barcelona blood cell datasettask:bloodmnist_224 —[uses_dataset]→ dataset:Barcelona blood cell datasettask:breast_wdbc —[uses_dataset]→ dataset:scikit-learn bundled WDBCtask:breastmnist —[uses_dataset]→ dataset:BUSItask:breastmnist_224 —[uses_dataset]→ dataset:BUSItask:coil2000_caravan —[uses_dataset]→ dataset:UCI CoIL Challenge 2000 (tic-mld)task:dermamnist —[uses_dataset]→ dataset:HAM10000task:dermamnist_224 —[uses_dataset]→ dataset:HAM10000task:diabetes_pima —[uses_dataset]→ dataset:UCI Pima Indians Diabetestask:dry_bean —[uses_dataset]→ dataset:UCI Dry Bean Datasettask:german_credit —[uses_dataset]→ dataset:UCI Statlog German Credittask:heart_cleveland —[uses_dataset]→ dataset:UCI heart-disease, processed.clevelandtask:jobpost_fraud —[uses_dataset]→ dataset:EMSCAD (Employment Scam Aegean Dataset)task:landsat_statlog —[uses_dataset]→ dataset:UCI Statlog (Landsat Satellite)task:ledgar —[uses_dataset]→ dataset:LexGLUE / LEDGAR (SEC EDGAR filings)task:medabstracts —[uses_dataset]→ dataset:Medical Abstracts TC Corpustask:occupancy_detection —[uses_dataset]→ dataset:UCI Occupancy Detectiontask:occupancy_detection_2 —[uses_dataset]→ dataset:UCI Occupancy Detectiontask:octmnist —[uses_dataset]→ dataset:Kermany OCTtask:organamnist —[uses_dataset]→ dataset:Liver Tumor Segmentation Benchmark (LiTS)task:organcmnist —[uses_dataset]→ dataset:Liver Tumor Segmentation Benchmark (LiTS)task:organcmnist_224 —[uses_dataset]→ dataset:Liver Tumor Segmentation Benchmark (LiTS)task:organsmnist —[uses_dataset]→ dataset:Liver Tumor Segmentation Benchmark (LiTS)task:pathmnist —[uses_dataset]→ dataset:NCT-CRC-HE-100K / CRC-VAL-HE-7Ktask:pneumoniamnist —[uses_dataset]→ dataset:Kermany pneumoniatask:pneumoniamnist_224 —[uses_dataset]→ dataset:Kermany pneumoniatask:retinamnist —[uses_dataset]→ dataset:DeepDRiDtask:retinamnist_224 —[uses_dataset]→ dataset:DeepDRiDtask:secom —[uses_dataset]→ dataset:UCI SECOMtask:steel_plate_faults —[uses_dataset]→ dataset:Semeion Research Center / UCI Steel Plates Faultstask:tissuemnist —[uses_dataset]→ dataset:BBBC051 / Broadtask:wine_quality_red —[uses_dataset]→ dataset:UCI Wine Qualitytask:wine_quality_white —[uses_dataset]→ dataset:UCI Wine Qualityaxial acquisition_setting · medicine 5 edgescoronal acquisition_setting · medicine 5 edgesred (vinho verde) acquisition_setting · agriculture 3 edgessagittal acquisition_setting · medicine 5 edgestest period 1 acquisition_setting · energy 3 edgestest period 2 acquisition_setting · energy 3 edgeswhite (vinho verde) acquisition_setting · agriculture 3 edges7ab31ab2d451 code_fingerprint 10 edgesa158da61099e code_fingerprint 10 edgesb444c02112cc code_fingerprint 19 edgesb5b34c074f7f code_fingerprint 3 edgesdde8cf648b5e code_fingerprint 1 edgesde32bca72d56 code_fingerprint 4 edgesBBBC051 / Broad dataset · medicine 1 edgesBUSI dataset · medicine 2 edgesBarcelona blood cell dataset dataset · medicine 6 edgesDeepDRiD dataset · medicine 2 edgesEMSCAD (Employment Scam Aegean Dataset) dataset · labour 1 edgesHAM10000 dataset · medicine 2 edgesKermany OCT dataset · medicine 1 edgesKermany pneumonia dataset · medicine 2 edgesLexGLUE / LEDGAR (SEC EDGAR filings) dataset · legal 1 edgesLiver Tumor Segmentation Benchmark (LiTS) dataset · medicine 4 edgesMedical Abstracts TC Corpus dataset · medicine 1 edgesNCT-CRC-HE-100K / CRC-VAL-HE-7K dataset · medicine 1 edgesSemeion Research Center / UCI Steel Plates Faults dataset · industrial 1 edgesUCI Adult / Census Income dataset · labour 1 edgesUCI Anuran Calls (MFCCs) dataset · ecology 1 edgesUCI CoIL Challenge 2000 (tic-mld) dataset · financial 1 edgesUCI Dry Bean Dataset dataset · agriculture 1 edgesUCI Occupancy Detection dataset · energy 2 edgesUCI Pima Indians Diabetes dataset · medicine 1 edgesUCI SECOM dataset · industrial 1 edgesUCI Statlog (Landsat Satellite) dataset · earth 1 edgesUCI Statlog German Credit dataset · financial 1 edgesUCI Wine Quality dataset · agriculture 2 edgesUCI heart-disease, processed.cleveland dataset · medicine 1 edgesscikit-learn bundled WDBC dataset · medicine 1 edgesAgriculture domain · agriculture 3 edgesAlzheimers/cdr-sb domain · alzheimers/cdr-sb 1 edgesEarth domain · earth 1 edgesEcology domain · ecology 1 edgesEnergy domain · energy 2 edgesFinancial domain · financial 2 edgesIndustrial domain · industrial 2 edgesLabour domain · labour 2 edgesLegal domain · legal 1 edgesMedicine domain · medicine 22 edgesMedicineanchor generation · medicine 1 edgesgeneration 1 generation · medicine 8 edgesgeneration 2 generation · medicine 7 edgespublic control arm generation · medicine 6 edgesBioacoustic / MFCC modality · ecology 1 edgesCT modality · medicine 4 edgesChest X-ray modality · medicine 2 edgesClinical text modality · medicine 1 edgesDermatoscopy modality · medicine 2 edgesFundus modality · medicine 2 edgesHistopathology modality · medicine 1 edgesLegal text modality · legal 1 edgesMicroscopy modality · medicine 3 edgesOCT modality · medicine 1 edgesPrognostic model / clinical trial modality · medicine 2 edgesRecruitment text modality · labour 1 edgesTabular / clinical modality · medicine 2 edgesTabular / environmental sensors modality · energy 2 edgesTabular / financial modality · financial 1 edgesTabular / imaging-derived modality · medicine 3 edgesTabular / insurance modality · financial 1 edgesTabular / multispectral modality · earth 1 edgesTabular / physicochemical modality · agriculture 2 edgesTabular / process sensors modality · industrial 1 edgesTabular / socioeconomic modality · labour 1 edgesUltrasound modality · medicine 2 edgesBaseline severity only (standard of care) model 12 edgesBaseline severity only (standard of care) model 12 edgesBiomedBERT frozen + linear probe model 12 edgesBiomedCLIP ViT-B/16 fine-tuned model 7 edgesBiomedCLIP ViT-B/16 frozen + linear probe model 24 edgesBiomedCLIP ViT-B/16 frozen + …BiomedCLIP ViT-B/16, zero-shot model 24 edgesBiomedCLIP ViT-B/16, zero-shotSmall CNN, trained from scratch model 22 edgesSmall CNN, trained from scrat…Covariate shopping over 20 candidate scores model 13 edgesCovariate shopping over 20 candidate scores model 13 edgesDINOv2 ViT-B/14 frozen + linear probe model 24 edgesDINOv2 ViT-B/14 frozen + line…GTE-base frozen + linear probe model 11 edgesHOG + logistic regression model 25 edgesHOG + logistic regressionMLP (256) on raw pixels model 25 edgesMLP (256) on raw pixelsPCA-64 + logistic regression model 25 edgesPCA-64 + logistic regressionPubMedBERT-sentence frozen + linear probe model 11 edgesResNet-18 (ImageNet) fine-tuned model 22 edgesResNet-18 (ImageNet) frozen features + linear probe model 25 edgesResNet-18 (ImageNet) frozen f…Random forest on raw pixels model 26 edgesRandom forest on raw pixelsGradient boosting model 21 edgesLogistic regression model 21 edgesMLP (128, 64) model 21 edgesRandom forest model 21 edgesTF-IDF + logistic regression model 11 edgesTF-IDF + MLP (256) model 11 edgesTF-IDF + complement naive Bayes model 11 edgesTF-IDF + linear SVM (Platt-scaled) model 11 edgesDELIBERATELY BROKEN twin -- anti-correlated, wrong scale model 12 edgesDELIBERATELY BROKEN twin -- anti-correlated, wrong scale model 12 edgesDELIBERATELY BROKEN twin -- non-monotone (magnitude, not direction) model 12 edgesDELIBERATELY BROKEN twin -- non-monotone (magnitude, not direction) model 12 edgesDegenerate twin (constant output) model 12 edgesDegenerate twin (constant output) model 12 edgesPrognostic twin, R^2 0.40 (specified quality) model 12 edgesPrognostic twin, R^2 0.40 (specified quality) model 12 edgesPrognostic twin, R^2 0.60 (specified quality) model 12 edgesPrognostic twin, R^2 0.60 (specified quality) model 12 edgesPrognostic twin, R^2 0.80 (specified quality) model 12 edgesPrognostic twin, R^2 0.80 (specified quality) model 12 edgesUseless twin (pure noise) model 12 edgesUseless twin (pure noise) model 12 edgesTransferred twin (age only) model 12 edgesTransferred twin (age only) model 12 edgesMedEval-1 v0.1 spec_version 22 edgesMedEval-1 v0.1 + T-PV1 (prognostic validity extension, draft) spec_version 20 edgesCensus income (>$50K) task · labour 7 edgesAnuran call species (10-class) task · ecology 7 edgesPeripheral blood cells (8-class) task · medicine 14 edgesPeripheral blood cells (8-class) @224px task · medicine 7 edgesBreast cytology (WDBC) task · medicine 7 edgesBreast ultrasound (malignancy) task · medicine 14 edgesBreast ultrasound (malignancy) @224px task · medicine 8 edgesCaravan insurance purchase (CoIL 2000) task · financial 7 edgesDermatoscopy (7-class skin lesion) task · medicine 14 edgesDermatoscopy (7-class skin lesion) @224px task · medicine 7 edgesDiabetes onset (Pima) task · medicine 7 edgesDry bean variety (7-class) task · agriculture 7 edgesConsumer credit risk (Statlog) task · financial 7 edgesCoronary artery disease (Cleveland) task · medicine 7 edgesFraudulent job posting detection task · labour 10 edgesLandsat satellite land cover (6-class) task · earth 7 edgesContract provision type (100-class) task · legal 10 edgesMedical abstracts (5-class condition) task · medicine 10 edgesRoom occupancy from sensors (period 1) task · energy 9 edgesRoom occupancy from sensors (period 2) task · energy 9 edgesRetinal OCT (4-class) task · medicine 10 edgesAbdominal CT organs — axial (A) task · medicine 14 edgesAbdominal CT organs — coronal (C) task · medicine 17 edgesAbdominal CT organs — coronal (C) @224px task · medicine 9 edgesAbdominal CT organs — sagittal (S) task · medicine 14 edgesColorectal pathology (9-class tissue) task · medicine 10 edgesPaediatric chest X-ray (pneumonia) task · medicine 14 edgesPaediatric chest X-ray (pneumonia) @224px task · medicine 7 edgesPrognostic-model trial validity (PROCOVA) task · medicine 13 edgesPrognostic-model trial validity (PROCOVA) task · alzheimers/cdr-sb 13 edgesFundus photography (DR grade) task · medicine 14 edgesFundus photography (DR grade) @224px task · medicine 8 edgesSemiconductor fabrication pass/fail task · industrial 7 edgesSteel plate surface faults (7-class) task · industrial 7 edgesKidney cortex cells (8-class) task · medicine 10 edgesWine quality, red (binarised) task · agriculture 9 edgesWine quality, white (binarised) task · agriculture 9 edges

155 nodes and 632 edges shown, the 10 busiest labelled. Click any node for its record; hover a legend row to light that type up. Layout is a deterministic force simulation with no transcendental arithmetic in it, so it draws the same every time, in every engine.

Not drawn · 46 unconnectedd50ab00f9ad4 code_fingerprint · Tyto Insights for Eardrum Bulging Detection regulatory_approval · Deep Capsule® (Deep Capsule US) regulatory_approval · Magnifico Open (100009900) regulatory_approval · Tyto Stethoscope (G3) regulatory_approval · Trinias regulatory_approval · Butterfly Gestational Age Tool regulatory_approval · InferCare RECIST regulatory_approval · SurgiCount+ System regulatory_approval · syngo.via RT Image Suite VC10 regulatory_approval · ECG-AI Pulmonary Hypertension (PH) 12-Lead algorithm (1020) regulatory_approval · JLK-NCCT regulatory_approval · Sonio Detect (v3) regulatory_approval · CEPHX3D regulatory_approval · CT Rembra RT; CT Areta RT; CT Rembra regulatory_approval · Contour ProtégéAI+ regulatory_approval · Stealth AXiS Cranial clinical application regulatory_approval · LiverMultiScan (v6.0) regulatory_approval · EarliPoint Assessment regulatory_approval · Photonova Spectra, Photonova Spectra Select regulatory_approval · VELYS™ Hip Navigation regulatory_approval · SOMATOM X.cite; SOMATOM X.ceed regulatory_approval · Alphenix, INFX-8000V/B, INFX-8000V/S, V9.6 with aEvolve Imaging (FOV Extension) regulatory_approval · Clarius Ejection Fraction AI regulatory_approval · EPIQ Series Diagnostic Ultrasound System, Affiniti Series Diagnostic Ultrasound System regulatory_approval · EchoNavigator R5.0 regulatory_approval · Vantage Fortian/Orian 1.5T, MRT-1550, V10.0 with AiCE Reconstruction Processing Unit for MR regulatory_approval · Spectral CT Verida Family regulatory_approval · Onera SleepMap (SLEEPMAP) regulatory_approval · True Definition DL regulatory_approval · SwiftMR regulatory_approval · Lunit INSIGHT DBT (V1.2) regulatory_approval · Annalise Enterprise regulatory_approval · QT Scanner 2000 Model A regulatory_approval · Data Analysis Facilitation Suite (DAFS) regulatory_approval · Automated Aortic Stenosis Software (AutoAS) regulatory_approval · AiORTA - Plan v2.0 regulatory_approval · Aquilion ServeSP (TSX-307B) V2.0 regulatory_approval · Bunkerhill Contrast CAC regulatory_approval · Bunkerhill Contrast AVC regulatory_approval · AV Cardiac CT regulatory_approval · AutoContour (RADAC V5) regulatory_approval · LOGIQ Vita; LOGIQ Vita Pro; LOGIQ Vita Express; LOGIQ Vita Plus; LOGIQ Vita Power; LOGIQ S20; LOGIQ S20 Pro; LOGIQ S20 Express; LOGIQ S20 Plus; LOGIQ S20 Power regulatory_approval · S-scan Open (100001800) regulatory_approval · Claire™ OCT System regulatory_approval · MedEval-1 v0.1 -- held-out track HP-1 spec_version
These carry no edge under the current filter, so they are listed rather than plotted — a force layout pushes an unconnected node to the frame edge and squashes the rest of the graph to fit it.
Node types
Click to hide a type.
Node types with nothing in them
  • Hospital / site0
  • Deployment0
  • Scanner (physical equipment)0
  • Clinician0
  • Publication0
Defined in the schema, populated by nothing. Hover for what each one would need. These counts are real zeros, not missing data.
Edge types
Edge types with nothing in them
  • deployed at0
  • approved for0
  • reported in0
Defined in the schema, populated by nothing. Hover for what each one would need. These counts are real zeros, not missing data.

Empty types: Hospital / site, Deployment, Scanner (physical equipment), Clinician, Publication. Each would need deployment-level records that this repo does not have and does not pretend to have.

§4b

Two more queries

Which tasks share a dataset? (contamination-risk view)

src/tasks.py registry `source` field

  • BUSI
    Breast ultrasound (malignancy) · Breast ultrasound (malignancy) @224px
  • Barcelona blood cell dataset
    Peripheral blood cells (8-class) · Peripheral blood cells (8-class) @224px
  • DeepDRiD
    Fundus photography (DR grade) · Fundus photography (DR grade) @224px
  • HAM10000
    Dermatoscopy (7-class skin lesion) · Dermatoscopy (7-class skin lesion) @224px
  • Kermany pneumonia
    Paediatric chest X-ray (pneumonia) · Paediatric chest X-ray (pneumonia) @224px
  • Liver Tumor Segmentation Benchmark (LiTS)
    Abdominal CT organs — axial (A) · Abdominal CT organs — coronal (C) · Abdominal CT organs — coronal (C) @224px · Abdominal CT organs — sagittal (S)
  • UCI Occupancy Detection
    Room occupancy from sensors (period 1) · Room occupancy from sensors (period 2)
  • UCI Wine Quality
    Wine quality, red (binarised) · Wine quality, white (binarised)

Tasks sharing a corpus cannot be treated as independent evidence. Here that sharing is deliberate — it is what makes the cross-setting query above possible.

Which model families fail on which modalities?

record `error` (harness failure) and `certification` (FAIL verdict)

Harness errors are currently zero: every one of the evaluations in results/records completed. The rows below are certification failures — models that ran and were judged unfit.

  • Covariate shopping over 20 candidate scores procedure
    certification FAIL on Prognostic-model trial validity (PROCOVA) (Prognostic model / clinical trial)
    Not a model -- a procedure. Every candidate is a legitimate pre-randomisation score; the selection rule is what breaks the trial. Invisible to a protocol review, visible to a type-I measurement.
  • Covariate shopping over 20 candidate scores procedure
    certification FAIL on Prognostic-model trial validity (PROCOVA) (Prognostic model / clinical trial)
    Not a model -- a procedure. Every candidate is a legitimate pre-randomisation score; the selection rule is what breaks the trial. Invisible to a protocol review, visible to a type-I measurement.

Harness errors: 0 · certification failures: 2. Both are published, including our own.

§3

How this file is made

python src/graph.py --out ../site-data/graph.json reads results/records/*.json, results/cross_site/*.json, results/heldout/ledger.jsonl, src/tasks.py (registry), data/registries/registry_nodes.json (public regulatory record, retrieved 2026-08-01T10:39:32Z) and writes the JSON this page renders, plus a .graphml beside it for anyone who wants the same graph in Gephi or Neo4j. The emitter computes no new science and re-derives no published score.