Metadata-Version: 2.4
Name: doc-ai-runtime
Version: 0.2.0
Summary: Modular Document AI Runtime for RAG and Markdown exports.
Author-email: Alain Kalombo <alain.kalombo@anztech.dev>
License: MIT
Description-Content-Type: text/markdown
License-File: LICENSE
Requires-Dist: python-docx
Requires-Dist: python-pptx
Requires-Dist: openpyxl
Requires-Dist: pytesseract
Requires-Dist: Pillow
Requires-Dist: PyMuPDF
Requires-Dist: surya-ocr
Requires-Dist: ollama
Dynamic: license-file

# 📄 Document AI Runtime

Un pipeline modulaire et extensible pour l'extraction de documents (OCR et Bureautique), conçu pour transformer des PDF, images et Word en formats structurés (Markdown et RAG).

Inspiré des capacités de solutions comme ABBYY, ce runtime repose sur une architecture de plugins indépendants manipulant un modèle de données canonique (DOM). 

## 🚀 Fonctionnalités

* **Multi-Formats natifs et VLM :**
  * **Bureautique (Path B)** : DOCX, XLSX (Excel), PPTX (PowerPoint) extraits nativement.
  * **PDF Hybride** : Extrait le calque texte natif, et bascule automatiquement sur la vision IA (Ollama) pour les pages scannées.
  * **Images (Path A)** : JPG, PNG traités via Qwen2.5-VL (VLM) qui comprend le layout et génère du Markdown directement.
* **Exports spécialisés :** Markdown (structuré) et RAG (JSON chunké avec métadonnées).

## 📦 Installation

### 1. Prérequis Python

Installer la bibliothèque et ses dépendances :

	```bash
	pip install -e .
	(Dépendances : python-docx, openpyxl, python-pptx, PyMuPDF, Pillow, ollama)

2. Dépendances Système : Ollama

	Ce runtime utilise Ollama pour l'OCR et la vision.

Installez Ollama.

	Téléchargez le modèle de vision Qwen :
	ollama pull qwen2.5vl:7b
	Assurez-vous que le serveur Ollama tourne en arrière-plan (ollama serve).

🏃 Utilisation

	Le runtime s'utilise via une interface en ligne de commande ou en l'important comme une bibliothèque.

CLI

	python main.py --file mon_document.pdf --export markdown

Bibliothèque

	from src.core.pipeline.runner import PipelineRunner

	runner = PipelineRunner()

# Pour un PDF ou une Image -> Export Markdown

	result_md = runner.process("mon_document.pdf", export_mode="markdown")
	print(result_md)

# Pour un Word -> Export RAG

	result_rag = runner.process("mon_document.docx", export_mode="rag")
	print(result_rag)

🛠 Architecture

Le projet est construit autour de 4 piliers :

	Le DOM (Document Object Model) : Des classes Python (Document, Page, Region, Block, Table, Cell) qui modélisent le document.
	Les Interfaces : IDocumentLoader et IDocumentPlugin garantissent que tous les modules communiquent avec le même langage.
	Les Plugins : Chaque étape (chargement, OCR) est un module interchangeable dans src/plugins/.
	Le Pipeline Runner : L'orchestrateur qui détecte le type de fichier et exécute le bon chemin (A ou B) automatiquement.

🗂 Structure du dépôt

	doc-ai-runtime/
	├── src/
	│   ├── core/               # Le cœur (DOM, Interfaces, Runner)
	│   │   ├── dom/            # Modèles de données (Document, Page, Block...)
	│   │   └── pipeline/       # Orchestrateur (runner.py)
	│   ├── plugins/            # Les briques interchangeables
	│   │   ├── loaders/        # ImageLoader, PdfLoader, DocxLoader, XlsxLoader, PptxLoader
	│   │   └── ocr/           # QwenOCRPlugin (Ollama VLM)
	│   └── exporters/         # MarkdownExporter, RagExporter
	├── main.py                 # Interface CLI
	└── README.md
