Metadata-Version: 2.4
Name: open_corpus_bo_es
Version: 0.1.0
Summary: Corpus en español del Estado Plurinacional de Bolivia para procesamiento de lenguaje natural
Author: Omar Elias Yana Cerezo
Author-email: Omar Elias Yana Cerezo <omar182_ya@hotmail.com>
License: MIT
Requires-Python: >=3.10
Description-Content-Type: text/markdown
License-File: LICENSE
Requires-Dist: nltk
Requires-Dist: pandas
Requires-Dist: gdown
Requires-Dist: pyarrow
Requires-Dist: fastparquet
Requires-Dist: tqdm
Dynamic: author
Dynamic: license-file
Dynamic: requires-python

# Open Corpus BO-ES

Open Corpus BO-ES es una biblioteca de Python para descargar y cargar corpus y recursos lingüísticos en español del Estado Plurinacional de Bolivia. Está orientada a facilitar el acceso a conjuntos de datos para tareas de Procesamiento del Lenguaje Natural (PLN).

## Características

- Descarga automática de corpus y recursos.
- Carga de corpus en formato Parquet.
- Catálogo de corpus mediante `catalog.json`.
- Uso desde Python o desde la línea de comandos.

## Instalación

```bash
pip install open-corpus-bo-es
```

## Uso

### Listar corpus disponibles

```python
from open_corpus_bo_es import list_corpus

print(list_corpus())
```

### Descargar un corpus

```python
from open_corpus_bo_es import download_corpus

download_corpus("nombre_del_corpus")
```

### Cargar un corpus

```python
from open_corpus_bo_es import load_corpus

datos = load_corpus("nombre_del_corpus")
print(datos.head())
```

## Ejemplo completo

```python
from open_corpus_bo_es import (
    list_corpus,
    download_corpus,
    load_corpus,
)

print(list_corpus())

download_corpus("nombre_del_corpus")

datos = load_corpus("nombre_del_corpus")

print(datos.head())
```

## Autor y Créditos

**Omar Elias Yana Cerezo**
omar182_ya@hotmail.com

## Licencia

Este proyecto se distribuye bajo la licencia MIT.
