feat(rag): provisiona busca RAG do G-ART e corrige indexação que abortava em chunk grande

Cria rag/ (schema, busca híbrida densa+lexical com RRF em search.py/
search_gart.sh, SETUP.md) — o projeto já tinha admin/update_rag.py para
indexar, mas nenhuma forma de consultar o índice. Corrige admin/update_rag.py:
um chunk denso em tokens (code/fcpxml/font_metrics.py) estourava o contexto
do modelo de embedding e derrubava a transação inteira; agora só aquele
chunk é pulado. Banco rag_gart provisionado no rag-hub-db compartilhado e
primeira indexação completa rodada (304 arquivos, 1702 chunks).

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
This commit is contained in:
João Henrique
2026-09-23 09:38:46 -04:00
co-authored by Claude Sonnet 5
parent d13f643ebc
commit e9a17c1b62
11 changed files with 1066 additions and 0 deletions
+12
View File
@@ -0,0 +1,12 @@
# Copie para admin/gart-rag.env e preencha a senha. Este arquivo é apenas um
# modelo; admin/gart-rag.env é ignorado pelo git.
RAG_DB_HOST=127.0.0.1
RAG_DB_PORT=55435
RAG_DB_NAME=rag_gart
RAG_DB_SCHEMA=gart
RAG_DB_USER=gart_rag_indexer
RAG_DB_PASSWORD=
# Ollama que fornece nomic-embed-text.
OLLAMA_URL=http://127.0.0.1:11434
RAG_EMBED_MODEL=nomic-embed-text