• LIGHTNING FAST • POLARS BACKEND • ZERO BLACK-BOX AI • DETERMINISTIC • NO DATA LEAKAGE • AGENTIC ORCHESTRATOR • LIGHTNING FAST • POLARS BACKEND • ZERO BLACK-BOX AI • DETERMINISTIC • NO DATA LEAKAGE • AGENTIC ORCHESTRATOR

PYTHON SDK INSTALLATION

Integrate DATADOC's blazing-fast dataset engineering capabilities directly into your backend services, ML pipelines, or Jupyter Notebooks.

Installation

DATADOC is published on PyPI. Install it using standard package managers:

# Standard pip installation
pip install datadoc-cli

# If using uv (recommended for speed)
uv pip install datadoc-cli

Quickstart SDK Usage

import polars as pl
from datadoc.core.engine import DATADOC

# Initialize engine
doc = DATADOC("your_raw_dataset.csv")

# Autonomously engineer
clean_dataframe = doc.engineer()

# Save output
clean_dataframe.write_csv("engineered_dataset.csv")

Environment Variables

If you plan to use the Agentic Orchestrator (--ai) via the Python SDK or CLI, ensure you configure your API keys.

# Create a .env file in your working directory
DATADOC_MODEL=groq/llama-3.3-70b-versatile
GROQ_API_KEY=gsk_your_api_key_here
GEMINI_API_KEY=AIza_your_api_key_here

The SDK automatically loads .env variables at runtime.