load_latest_parquet
load_latest_parquet(spark=None, data_base=None, schema=None, table=None, env=None)
Carga el parquet más reciente para la tabla solicitada desde /Volumes/bronze/{db}_{schema}/{env}/{table}/.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| data_base | str | Nombre de base lógica. |
| schema | str | Nombre de esquema. |
| table | str | Nombre de tabla. |
| env | str | None | Ambiente; si no se pasa, usa ENV o dev. |
Retorna: DataFrame de Spark o None si no encuentra archivos.
df_clientes = io.load_latest_parquet(
spark=spark,
data_base="timepro",
schema="insudb",
table="clientes",
env="dev"
)
return_parquets_and_register_temp_views
return_parquets_and_register_temp_views(spark=None, tables_load=None, verbose=False, env=None)
Lee parquets según configuración y crea vistas temporales. Devuelve los DataFrames en un diccionario.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| tables_load | dict | Mapa de carga por base/esquema/lista de tablas y vistas. |
| verbose | bool | Imprime mensajes de estado. |
| env | str | None | Ambiente de lectura. |
Retorna: dict con claves db.schema.table y valores DataFrame.
parquets_register_temp_views
parquets_register_temp_views(spark=None, tables_load=None, verbose=False, env=None)
Misma carga de parquets que la función anterior, pero sin devolver diccionario.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| tables_load | dict | Configuración de tablas/vistas. |
| verbose | bool | Mensajes de materialización. |
| env | str | None | Ambiente de lectura. |
Retorna: None.
load_latest_excel
load_latest_excel(spark=None, source_file=None, env=None)
Carga el último archivo Excel desde /Volumes/bronze/excel/{env}/{source_file}/ y lo convierte a DataFrame Spark.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| source_file | str | Ruta relativa del archivo dentro de bronze/excel. |
| env | str | None | Ambiente de lectura. |
Retorna: DataFrame de Spark o None si falla/no hay archivos.
return_excels_and_register_temp_views
return_excels_and_register_temp_views(spark=None, files_load=None, verbose=False, env=None)
Carga Excels configurados, crea vistas temporales y devuelve diccionario de DataFrames.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| files_load | dict | Configuración dominio/subdominio/lista de archivos-vistas. |
| verbose | bool | Mensajes de materialización. |
| env | str | None | Ambiente de lectura. |
Retorna: dict con claves dominio.subdominio.archivo y valores DataFrame.
excels_register_temp_views
excels_register_temp_views(spark=None, files_load=None, verbose=False, env=None)
Carga Excels y materializa vistas temporales sin retornar estructura adicional.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| files_load | dict | Configuración de archivos y vistas. |
| verbose | bool | Mensajes de materialización. |
| env | str | None | Ambiente de lectura. |
Retorna: None.
load_and_materialize_views
load_and_materialize_views(action, **kwargs)
Dispatcher para acciones de carga: parquets/excels con o sin retorno.
| Parámetro | Tipo | Descripción |
| action | str | Nombre de acción soportada. |
| kwargs | dict | Parámetros de la acción seleccionada. |
Retorna: dict resultante de la acción; {} si no existe.
tables_load = {
"timepro": {"insudb": [{"table": "clientes", "view": "vw_clientes"}]}
}
out = io.load_and_materialize_views(
action="return_parquets_and_register_temp_views",
spark=spark,
tables_load=tables_load,
env="dev"
)
save_table_to_delta
save_table_to_delta(spark=None, df=None, catalog=None, schema=None, table_name=None, mode="overwrite")
Guarda un DataFrame en formato Delta usando el modo de escritura indicado y lo registra en el metastore.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| df | DataFrame | Dataset de entrada a persistir. |
| catalog | str | Catálogo destino base. |
| schema | str | Esquema destino. |
| table_name | str | Nombre de tabla destino. |
| mode | str | Modo de escritura de Spark; por defecto overwrite. |
Retorna: None.
io.save_table_to_delta(
spark=spark,
df=df_clientes,
catalog="fi_comunes",
schema="silver",
table_name="dim_cliente",
mode="overwrite"
)
save_snapshot_to_delta
save_snapshot_to_delta(spark=None, df=None, catalog=None, schema=None, table_name=None, snapshot_column=None)
Guarda un snapshot de una tabla fact en Delta, borrando previamente el rango de snapshot/time_key que llega en el DataFrame.
| Parámetro | Tipo | Descripción |
| spark | SparkSession | None | Sesión opcional. |
| df | DataFrame | Dataset de entrada a persistir. |
| catalog | str | Catálogo destino base. |
| schema | str | Esquema destino. |
| table_name | str | Nombre de tabla destino. |
| snapshot_column | str | Columna que identifica el snapshot o time_key. |
Retorna: None.
io.save_snapshot_to_delta(
spark=spark,
df=df_fact_ventas,
catalog="fi_comunes",
schema="gold",
table_name="fact_ventas_snapshot",
snapshot_column="time_key"
)