Metadata-Version: 2.4
Name: my-data-explorer
Version: 0.1.0
Summary: Explorador de schemas do OneLake/Microsoft Fabric: metadados, analitico, chaves candidatas e amostras em Excel.
Author: Cristiane
License: MIT
Project-URL: Homepage, https://example.com/my-data-explorer
Keywords: fabric,onelake,data-governance,data-quality,spark,delta
Classifier: Programming Language :: Python :: 3
Classifier: License :: OSI Approved :: MIT License
Classifier: Operating System :: OS Independent
Classifier: Intended Audience :: Information Technology
Classifier: Topic :: Database
Requires-Python: >=3.9
Description-Content-Type: text/markdown
License-File: LICENSE
Requires-Dist: openpyxl>=3.1
Provides-Extra: dev
Requires-Dist: pyspark>=3.4; extra == "dev"
Requires-Dist: pandas>=1.5; extra == "dev"
Requires-Dist: build; extra == "dev"
Requires-Dist: twine; extra == "dev"
Requires-Dist: pytest; extra == "dev"
Dynamic: license-file

# my-data-explorer

Explorador de schemas (pastas) do **OneLake / Microsoft Fabric**. A partir de um
caminho `abfss://`, varre as tabelas, identifica o formato (Delta / Parquet /
CSV) e gera um **Excel** com metadados, analitico por coluna, chaves primarias
candidatas e uma amostra de cada tabela.

## Instalacao

```bash
pip install my-data-explorer
```

No Fabric, use o `.whl` gerado (ver "Build") em um **Environment** (Custom
Libraries) e selecione esse Environment no notebook.

## Uso

```python
from my_data_explorer import explorerThis, myHelp

myHelp()   # mostra todos os comandos e a documentacao

explorerThis(
    "abfss://der_prd@onelake.dfs.fabric.microsoft.com/"
    "derstorageprd.Lakehouse/Files/mnt/raw/ctb",
    "./builtin/myresultof_{schema}.xlsx",
    checkpoint="./builtin/ckpt_ctb.txt"
)
```

## Argumentos de `explorerThis`

| argumento | padrao | descricao |
|---|---|---|
| `schema` | (obrigatorio) | caminho `abfss://` da pasta do schema |
| `output` | `./builtin/myresultof_{schema}.xlsx` | saida; `{schema}` vira o nome do schema |
| `modes` | `True` | calcula a moda das colunas string |
| `distinct` | `"approx"` | `"approx"` (rapido) ou `"exact"` |
| `sample_rows` | `20` | linhas na aba de amostra (0 desliga) |
| `find_keys` | `True` | infere chaves candidatas |
| `composite_keys` | `False` | testa pares de colunas como chave |
| `checkpoint` | `None` | `.txt` para retomar de onde parou |

## Saida (abas)

- **Tabelas**: visao geral (formato, Delta?, linhas, colunas, chaves, status).
- **Colunas**: analitico por coluna, com marca `PK`.
- **amostra_<tabela>**: primeiras linhas de cada tabela.

## Build (gerar o wheel)

```bash
pip install build
python -m build            # gera dist/*.whl e dist/*.tar.gz
```

## Publicar no PyPI

```bash
pip install twine
twine upload dist/*        # pede seu token do PyPI
```

> O nome `my-data-explorer` precisa estar disponivel no PyPI. Para uso interno
> no Fabric voce nao precisa do PyPI publico: basta o `.whl` no Environment.

## Notas

- `pyspark` e `pandas` vem do runtime do Fabric e nao sao instalados pelo pip.
- "erros" = valores presentes porem invalidos (NaN em numericas, vazio/espacos
  em strings). Nulos sao contados separadamente.

## Licenca

MIT.
