PYTHON SDK INSTALLATION
Integrate DATADOC's blazing-fast dataset engineering capabilities directly into your backend services, ML pipelines, or Jupyter Notebooks.
Installation
DATADOC is published on PyPI. Install it using standard package managers:
# Standard pip installation
pip install datadoc-cli
# If using uv (recommended for speed)
uv pip install datadoc-cli
Quickstart SDK Usage
import polars as pl
from datadoc.core.engine import DATADOC
# Initialize engine
doc = DATADOC("your_raw_dataset.csv")
# Autonomously engineer
clean_dataframe = doc.engineer()
# Save output
clean_dataframe.write_csv("engineered_dataset.csv")
Environment Variables
If you plan to use the Agentic Orchestrator (--ai) via the Python SDK or CLI, ensure you configure your API keys.
# Create a .env file in your working directory
DATADOC_MODEL=groq/llama-3.3-70b-versatile
GROQ_API_KEY=gsk_your_api_key_here
GEMINI_API_KEY=AIza_your_api_key_here
The SDK automatically loads .env variables at runtime.