rewirebio.iobenchmarks
Dataset

Feng paQTL discrimination long-window dataset

Feng paQTL discrimination long-window scored population; Feng et al. 2025.

Research readiness

These checks assess whether the evidence supports a reproducible investigation. A source-checked score alone does not meet these requirements.

Release 2026-10-07-1448159e6a81 · Evidence verified: Not verified

Evidence incomplete

Replay metrics

Exact outcomes, predictions, identifiers and evaluator are connected.

Missing or unresolved evidence

  • No verified artifact manifest is linked to this exact record.
  • artifact hashes: verification is missing
  • join integrity: verification is missing
  • score semantics: verification is missing
  • metric replay: verification is missing

Verified: Not verified

Evidence incomplete

Investigate discrepancies

Replay evidence includes annotations and an assessment of dependence. Unknown independence permits descriptive analysis only.

Missing or unresolved evidence

  • No verified artifact manifest is linked to this exact record.
  • artifact hashes: verification is missing
  • join integrity: verification is missing
  • score semantics: verification is missing
  • metric replay: verification is missing
  • annotations: verification is missing
  • dependence: verification is missing

Verified: Not verified

Evidence incomplete

Run locally

A pinned recipe describes the inputs, environment and resource requirements.

Missing or unresolved evidence

  • No verified artifact manifest is linked to this exact record.
  • artifact hashes: verification is missing
  • join integrity: verification is missing
  • score semantics: verification is missing
  • recipe pinned: verification is missing
  • resource estimate: verification is missing

Verified: Not verified

Evidence incomplete

Validate independently

Separate data and exposure records support an independent test.

Missing or unresolved evidence

  • No verified artifact manifest is linked to this exact record.
  • artifact hashes: verification is missing
  • join integrity: verification is missing
  • score semantics: verification is missing
  • independent validation: verification is missing
  • overlap checked: verification is missing

Verified: Not verified

Readiness describes the evidence in this release. Availability on your computer is checked separately when an investigation runs. Existing data exposure can prevent independent validation even when files are available.

Artifacts and reproduction

No verified artifact manifest is connected to this record yet. The gaps above identify what is needed before analysis can begin.

Read reviewed discrepancy investigations

Evaluation results

5 evaluations · 10 results. Different protocols are not a single leaderboard.

Filter evaluations

Applied filters: All linked evaluations

Exact evaluated configurations and original reported results
Tested configurationProtocol and datasetFindingEvidence and details
Configuration: AlphaGenome, output tracks* (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.754 paQTL AUC
AUC · higher

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

AlphaGenome, output tracks* paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, AUC block, AlphaGenome, output tracks* row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md).
Configuration: AlphaGenome, output tracks* (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.982 paQTL Cohen’s d
Cohen's d · unknown

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

AlphaGenome, output tracks* paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, Cohen’s d block, AlphaGenome, output tracks* row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md). Signed effect size; no universal desirable sign/direction is stated by the source.
Configuration: Caduceus-Ph, long sequence (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.465 paQTL AUC
AUC · higher

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

Caduceus-Ph, long sequence paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, AUC block, Caduceus-Ph, long sequence row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md).
Configuration: Caduceus-Ph, long sequence (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
−0.1151 paQTL Cohen’s d
Cohen's d · unknown

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

Caduceus-Ph, long sequence paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, Cohen’s d block, Caduceus-Ph, long sequence row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md). Signed effect size; no universal desirable sign/direction is stated by the source.
Configuration: Enformer, hidden states* (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.674 paQTL AUC
AUC · higher

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

Enformer, hidden states* paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, AUC block, Enformer, hidden states* row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md).
Configuration: Enformer, hidden states* (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.603 paQTL Cohen’s d
Cohen's d · unknown

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

Enformer, hidden states* paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, Cohen’s d block, Enformer, hidden states* row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md). Signed effect size; no universal desirable sign/direction is stated by the source.
Configuration: Enformer, output tracks* (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.666 paQTL AUC
AUC · higher

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

Enformer, output tracks* paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, AUC block, Enformer, output tracks* row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md).
Configuration: Enformer, output tracks* (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.546 paQTL Cohen’s d
Cohen's d · unknown

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

Enformer, output tracks* paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, Cohen’s d block, Enformer, output tracks* row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md). Signed effect size; no universal desirable sign/direction is stated by the source.
Configuration: HyenaDNA-450K, long sequence (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.552 paQTL AUC
AUC · higher

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

HyenaDNA-450K, long sequence paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, AUC block, HyenaDNA-450K, long sequence row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md).
Configuration: HyenaDNA-450K, long sequence (paQTL discrimination)Protocol: Feng paQTL discrimination
Dataset: Feng paQTL discrimination long-window dataset
0.207 paQTL Cohen’s d
Cohen's d · unknown

Uncertainty: Not reported

Coverage: Not reported scored / Not reported eligible

Independent external evaluation · Source checked
Methods, coverage and source

HyenaDNA-450K, long sequence paQTL discrimination evaluation

Table 6, paQTL column, frozen embeddings + random forest classifier

Aggregation: Not reported

Benchmarking DNA foundation models for genomic and genetic tasks · Table 6, Cohen’s d block, HyenaDNA-450K, long sequence row, paQTL column (deterministic XML extraction; rowspans resolved per data/omics/amp-coverage-20261007/feng/review-notes.md). Signed effect size; no universal desirable sign/direction is stated by the source.

Source checking is not independent reproduction. Release 2026-10-07-1448159e6a81.

Dataset and evaluation context

A dataset supplies biological observations. The evaluation protocol defines how those observations are split, used and scored.

Evidence

Source checking verifies the cited claim or transcription. It does not establish independent reproduction.

Evidence table

Inspect claims, sources and review details

Trace each statement to its source and review. A context-only reference supports the record generally; it does not verify an individual field. Source checking does not reproduce an experiment.

One row per statement and cited source. Multiple citations are not independent evaluations. Shared locators are labelled explicitly.

5 evidence rows matching the loaded filters

Claims, original sources and review scope · Release 2026-10-07-1448159e6a81
Property and statementOriginal source and locationReview and provenance
attributes.population
Borzoi-derived GTEx v8 whole-blood putative causal variants paired with matched noncausal variants by distance to functional site/gene expression. paQTL pre-window-filter positive count: 142 (not an established per-model scored denominator; post-filter counts are unreported, recorded as null, not zero; this is a different population from the Table 5 pathogenic/common SNP short/long counts, never copied here). Long generated/chromosome-boundary-filtered window: 196,608 bp. A model's actual_input_bp may crop a smaller region from this generated window (e.g. AlphaGenome and long-sequence Caduceus-Ph each crop the central 131,072 bp); exact realised per-model scored counts after that crop are unextracted, not asserted as zero.
Context-only references
Benchmarking DNA foundation models for genomic and genetic tasks

Original source ↗

No field-specific location recorded

Version: PMC12663285.1
Retrieved: 2026-09-17T07:54:51.004119+00:00

not individually reviewed

No individual claim review recorded

Audit details

Field: attributes.population

Source artifact SHA-256: 5d8ca9bcf88cc1b38ad667906a2e4699b1aefa6d31c6f49259784930353f3202

Hash scope: Exact retrieved primary paper artifact bytes.

Inspected artifact

attributes.split
Three disjoint outer chromosome test groups (3/6/9/12/16/18/19/21; 2/5/11/14/17/20/22/X; 1/4/7/8/10/13/15), each held out in turn with fourfold inner-chromosome cross-validation for hyperparameter tuning.
Context-only references
Benchmarking DNA foundation models for genomic and genetic tasks

Original source ↗

No field-specific location recorded

Version: PMC12663285.1
Retrieved: 2026-09-17T07:54:51.004119+00:00

not individually reviewed

No individual claim review recorded

Audit details

Field: attributes.split

Source artifact SHA-256: 5d8ca9bcf88cc1b38ad667906a2e4699b1aefa6d31c6f49259784930353f3202

Hash scope: Exact retrieved primary paper artifact bytes.

Inspected artifact

attributes.version
Not reported
Context-only references
Benchmarking DNA foundation models for genomic and genetic tasks

Original source ↗

No field-specific location recorded

Version: PMC12663285.1
Retrieved: 2026-09-17T07:54:51.004119+00:00

missing or unspecified

No individual claim review recorded

Audit details

Field: attributes.version

Source artifact SHA-256: 5d8ca9bcf88cc1b38ad667906a2e4699b1aefa6d31c6f49259784930353f3202

Hash scope: Exact retrieved primary paper artifact bytes.

Inspected artifact

description
Feng paQTL discrimination long-window scored population; Feng et al. 2025.
Context-only references
Benchmarking DNA foundation models for genomic and genetic tasks

Original source ↗

No field-specific location recorded

Version: PMC12663285.1
Retrieved: 2026-09-17T07:54:51.004119+00:00

not individually reviewed

No individual claim review recorded

Audit details

Field: description

Source artifact SHA-256: 5d8ca9bcf88cc1b38ad667906a2e4699b1aefa6d31c6f49259784930353f3202

Hash scope: Exact retrieved primary paper artifact bytes.

Inspected artifact

name
Feng paQTL discrimination long-window dataset
Context-only references
Benchmarking DNA foundation models for genomic and genetic tasks

Original source ↗

No field-specific location recorded

Version: PMC12663285.1
Retrieved: 2026-09-17T07:54:51.004119+00:00

not individually reviewed

No individual claim review recorded

Audit details

Field: name

Source artifact SHA-256: 5d8ca9bcf88cc1b38ad667906a2e4699b1aefa6d31c6f49259784930353f3202

Hash scope: Exact retrieved primary paper artifact bytes.

Inspected artifact

Sources and history

View linked audit checks and correction history

Release 2026-10-07-1448159e6a81 · Record review: source checked

1 source records and release historyDownload this release
Technical metadata and extraction receipts

Stable ID: amp-feng-20261007-dataset-qtl-paqtl-long

areas
dna-genomes
missing metadata
split: Exact per-fold scored counts and post-window-filter denominators are unreported; not asserted as zero.
population
Borzoi-derived GTEx v8 whole-blood putative causal variants paired with matched noncausal variants by distance to functional site/gene expression. paQTL pre-window-filter positive count: 142 (not an established per-model scored denominator; post-filter counts are unreported, recorded as null, not zero; this is a different population from the Table 5 pathogenic/common SNP short/long counts, never copied here). Long generated/chromosome-boundary-filtered window: 196,608 bp. A model's actual_input_bp may crop a smaller region from this generated window (e.g. AlphaGenome and long-sequence Caduceus-Ph each crop the central 131,072 bp); exact realised per-model scored counts after that crop are unextracted, not asserted as zero.
split
Three disjoint outer chromosome test groups (3/6/9/12/16/18/19/21; 2/5/11/14/17/20/22/X; 1/4/7/8/10/13/15), each held out in turn with fourfold inner-chromosome cross-validation for hyperparameter tuning.
version
Not reported
Related records

Suggest a correction