data-eng-bench: benchmark results

Snowflake-Labs data-eng-bench (103 dbt data-engineering tasks, DuckDB backend) · agent: KISS SorcarAgent · models: claude-fable-5 (development) + gpt-5.6-sol (read-only review, ≤20% of task budget) · run date: 2026-08-09

Headline leaderboard scores

Every task ran 3 independent trials (309 trials total), exactly as the public leaderboard requires. Scores below use the leaderboard's own formulas (leaderboard/core/metrics.py): a trial succeeds iff its hidden pytest verifier awards reward > 0, and errored trials count as failures.

69.58% ± 0.86
Accuracy (mean reward, 215/309 trials)
71.84%
pass@2 (unbiased estimator)
72.82%
pass@3 (unbiased estimator)
68 / 103
tasks solved in all 3 trials
(7 partial, 28 unsolved)
$1,143.33
total model spend
$3.70
mean cost per trial
4h 24m
wall-clock runtime (10 concurrent trials)
0
harness exceptions in 309 trials

Success rate by difficulty

Easy100.0% (9/9)Medium72.9% (105/144)Hard67.4% (89/132)Very hard50.0% (12/24)

Success rate by category

Categories are taken from each task's task.toml metadata.

dbt-snapshots100.0% (3/3)debugging100.0% (6/6)finance100.0% (3/3)data-engineering83.3% (15/18)development82.1% (32/39)analytics69.8% (134/192)dbt-models58.3% (14/24)database38.1% (8/21)dbt0.0% (0/3)

How the benchmark was run

Harbor 0.20 orchestrates 309 trials KISS SorcarAgent claude-fable-5 + gpt-5.6-sol Docker trial container dbt + DuckDB retail warehouse + hidden verifier

Per-task results

✔ / ✘ marks are the three trial outcomes; cost is the summed model spend of the three trials.

TaskDifficultyCategoryTrialsPassesCost
dbt-abc-classificationMediumanalytics3/3$11.90
dbt-basket-composition-analysisHardanalytics3/3$13.83
dbt-calculate-running-balanceMediumanalytics3/3$9.22
dbt-campaign-performanceMediumdevelopment3/3$6.69
dbt-campaign-roi-analysisMediumdevelopment3/3$17.65
dbt-carrier-delivery-performanceMediumdevelopment3/3$9.68
dbt-cart-abandonment-recoveryMediumdevelopment3/3$6.63
dbt-channel-attribution-analysisMediumanalytics3/3$11.11
dbt-consolidateMediumanalytics3/3$2.86
dbt-customer-churn-cohortsVery hardanalytics3/3$15.89
dbt-customer-cohort-retentionMediumanalytics3/3$11.86
dbt-customer-cross-sell-insightsHardanalytics3/3$18.07
dbt-customer-geographicEasyanalytics3/3$8.80
dbt-customer-lifecycle-journeyMediumdevelopment3/3$8.67
dbt-customer-lifetime-valueHardanalytics3/3$14.66
dbt-customer-ltv-fixHardanalytics3/3$12.00
dbt-customer-order-analyticsMediumanalytics3/3$8.95
dbt-daily-order-summaryEasyanalytics3/3$8.28
dbt-dq-macro-enforcementHardanalytics3/3$13.81
dbt-email-campaign-trackerMediumdevelopment3/3$6.41
dbt-exchange-rate-settlement-dateHardanalytics3/3$11.64
dbt-fix-cac-payback-waterfallMediumanalytics3/3$7.56
dbt-fix-customer-churnMediumdbt-models3/3$4.19
dbt-fix-customer-snapshot-and-build-dimensionHarddbt-snapshots3/3$4.43
dbt-fix-daily-cohortsMediumdbt-models3/3$6.27
dbt-fix-daily-revenueMediumdbt-models3/3$8.91
dbt-fix-division-by-zeroMediumdebugging3/3$6.51
dbt-fix-email-attributionMediumanalytics3/3$7.80
dbt-fix-inventory-modelMediumdebugging3/3$6.64
dbt-fix-multi-touch-attributionHardanalytics3/3$13.75
dbt-fix-paid-search-attributionMediumanalytics3/3$15.65
dbt-fix-refund-reconciliationMediumdevelopment3/3$4.88
dbt-fix-timezone-salesMediumdbt-models3/3$15.40
dbt-fraud-detection-modelHardanalytics3/3$12.46
dbt-gl-reconciliationVery hardanalytics3/3$9.73
dbt-harbor-product-affinityHardanalytics3/3$16.32
dbt-harbor-warehouse-capacityHardanalytics3/3$10.60
dbt-hr-analyticsHardanalytics3/3$22.49
dbt-inventory-stockout-riskMediumanalytics3/3$18.73
dbt-loyalty-points-analysisHardanalytics3/3$6.27
dbt-multi-warehouse-stock-rebalanceHarddevelopment3/3$9.74
dbt-order-fulfillment-analyticsHardanalytics3/3$10.91
dbt-order-fulfillment-metricsHardanalytics3/3$7.39
dbt-order-reconciliationHardanalytics3/3$4.84
dbt-price-elasticityHardanalytics3/3$18.92
dbt-product-affinityHardanalytics3/3$15.53
dbt-product-category-analyticsHardanalytics3/3$7.96
dbt-product-performance-metricsMediumanalytics3/3$7.56
dbt-product-return-analysisMediumdevelopment3/3$6.08
dbt-product-sales-velocityHardanalytics3/3$11.30
dbt-receivables-aging-bucketsHardfinance3/3$12.70
dbt-retail-task-01-channel-revenueEasyanalytics3/3$7.61
dbt-retail-task-04-market-roiMediumanalytics3/3$7.88
dbt-retail-task-07-cart-recoveryHardanalytics3/3$9.88
dbt-retail-task-10-trust-riskHardanalytics3/3$15.43
dbt-rfm-customer-segmentationMediumanalytics3/3$8.48
dbt-rfm-customer-tieringVery hardanalytics3/3$17.38
dbt-session-attributionVery hardanalytics3/3$4.62
dbt-warehouse-fulfillment-analyticsMediumdevelopment3/3$10.43
dbt-web-session-analyticsMediumanalytics3/3$9.44
dbt-weekly-sales-growthMediumanalytics3/3$8.42
deferred-revenue-recognitionHarddatabase3/3$8.43
payment-risk-scoringMediumdata-engineering3/3$17.90
pos-operationsHarddata-engineering3/3$17.17
shipping-fulfillment-quality-scoringMediumdata-engineering3/3$10.39
time-decay-attribution-modelHarddatabase3/3$13.90
web-session-quality-scoringMediumdata-engineering3/3$12.02
workforce-analyticsHarddata-engineering3/3$16.64
dbt-coupon-effectivenessMediumanalytics2/3$17.81
dbt-customer-risk-scoringHardanalytics2/3$10.92
dbt-fix-customer-ltvMediumdbt-models2/3$17.66
tier-migration-analysisHarddatabase2/3$14.18
dbt-customer-retention-riskHarddevelopment1/3$9.08
dbt-fulfillment-slaMediumanalytics1/3$13.59
dbt-payment-analyticsMediumdevelopment1/3$6.70
cohort-retention-matrixHarddatabase0/3$6.80
dbt-customer-acquisition-channel-performanceHardanalytics0/3$13.20
dbt-customer-churn-early-warningMediumanalytics0/3$6.50
dbt-customer-cltv-forecastingHardanalytics0/3$10.79
dbt-fix-category-revenueHarddbt-models0/3$15.92
dbt-fix-inventory-balanceMediumdbt-models0/3$4.94
dbt-fix-marketing-attributionMediumanalytics0/3$7.23
dbt-fix-product-metricsMediumdbt-models0/3$6.60
dbt-fix-repeat-purchase-cohort-revenueMediumanalytics0/3$6.46
dbt-harbor-marketing-mix-modelHardanalytics0/3$16.85
dbt-incremental-late-arriving-salesHarddatabase0/3$10.32
dbt-inventory-analysisMediumanalytics0/3$18.01
dbt-inventory-turnover-analysisMediumdevelopment0/3$13.08
dbt-monthly-channel-revenueHardanalytics0/3$12.38
dbt-multicurrency-lifoVery hardanalytics0/3$16.17
dbt-order-interval-metricsMediumanalytics0/3$11.20
dbt-payment-fraud-analysisHardanalytics0/3$9.79
dbt-product-return-rate-analysisMediumanalytics0/3$16.87
dbt-rfm-customer-segmentation-2Mediumanalytics0/3$10.50
dbt-sales-funnel-analysisHardanalytics0/3$11.41
dbt-supplier-payment-optimizationVery hardanalytics0/3$10.44
dbt-supplier-scorecardVery hardanalytics0/3$11.18
dbt-test-orders-filterMediumanalytics0/3$7.97
dbt-three-way-matchingHardanalytics0/3$10.72
fifo-inventory-cogsHarddatabase0/3$14.41
late-arriving-orders-reconciliationHarddatabase0/3$9.08
marketing-campaigns-harborHarddata-engineering0/3$15.59
promotional-lift-analysisVery harddbt0/3$12.83

Observations

Submitting these results to the public leaderboard

Submission needs a Harbor Hub account (GitHub OAuth) and a GitHub PR, which require interactive human authentication, so they were not performed in this run. The job directory benchmarkings/jobs/2026-08-09__01-45-42 contains everything needed.
# 1. authenticate the harbor CLI (GitHub OAuth)
harbor auth login

# 2. upload the finished job publicly
harbor upload benchmarkings/jobs/2026-08-09__01-45-42 --public

# 3. open the submission PR from a data-eng-bench checkout
git clone https://github.com/Snowflake-Labs/data-eng-bench
cd data-eng-bench/leaderboard
uv run lb submit https://hub.harborframework.com/jobs/<uuid-from-step-2>