Projeto 01

Airflow Data Quality Pipeline

Data Engineering · Airflow · DuckDB

Projeto 02

FraudRisk Engine

Machine Learning · FastAPI · XGBoost

Projeto 03

AI Ops Approval Workflow

IA Generativa · Auditoria · Aprovação Humana

Projeto 04

QueryGuard RAG

Text-to-SQL · Guardrails · Auditoria

Projeto 05

Manufacturing Defect Detector

Visão Computacional · PaDiM · Anomalias

Projeto 06

RouteFlow AI

Logística · NLP · Otimização de Rotas

Sobre mim

Dados, modelos e produto com foco em problema real

Sou Iago Aragão, profissional em formação em Gestão de Dados na Universidade Federal do Piauí, com IRA 9.31/10. Trabalho com engenharia de dados, machine learning e IA aplicada em projetos que partem de uma pergunta prática e chegam a uma solução mensurável.

Nos projetos recentes, venho concentrando o portfólio em pipelines de qualidade de dados, backends de scoring, fluxos com aprovação humana e consultas Text-to-SQL com guardrails. Antes disso, atuei com bases fiscais e de produto com mais de 15 mil registros, automação de validações e melhoria de processos operacionais.

Backends com dados

Pipelines e APIs para ingestão, validação, métricas operacionais e consulta segura de dados analíticos.

Machine learning aplicado

Modelos de risco com XGBoost, limiares de revisão e avaliação temporal em dados altamente desbalanceados.

Dados e operação

Experiência com integridade de bases, análise exploratória e automações que reduziram tempo de auditoria manual.

Python SQL Pandas Scikit-learn XGBoost DuckDB Airflow FastAPI PyTorch Transformers RAG Streamlit Docker CI APIs REST
Portfólio

Projetos

Uma seleção de repositórios com pipelines de dados, backends, machine learning e IA generativa, com foco em validação, segurança e aplicação prática. Os cards indicam o contexto de cada trabalho para separar projetos aplicados e pesquisa aplicada.

Data Engineering Projeto 01
Projeto autoral

Airflow Data Quality Pipeline

Pipeline para varejo com preparação de dataset público, validações críticas, marts analíticos em DuckDB e API FastAPI para consulta.

  • Python
  • Airflow
  • DuckDB
  • FastAPI
GitHub API local
Machine Learning Projeto 02
Projeto autoral

FraudRisk Engine

Backend de scoring antifraude com seleção de limiares de revisão, API FastAPI e benchmark temporal no dataset ULB de cartão de crédito.

  • XGBoost
  • FastAPI
  • ROC-AUC 0.9762
  • Recall 84.6%
GitHub API local
AI Ops Projeto 03
Projeto autoral

AI Ops Approval Workflow

Backend para triagem operacional com classificação de risco, aprovação humana em casos sensíveis, SQLite, auditoria e workflow n8n.

  • FastAPI
  • SQLite
  • OpenAI opcional
  • n8n
GitHub Workflow local
Text-to-SQL Projeto 04
Projeto autoral

QueryGuard RAG

Backend Text-to-SQL com catálogo semântico, recuperação de schema, validação SQL, execução somente leitura e logs de auditoria.

  • RAG
  • SQLGlot
  • SQLite
  • Audit log
GitHub API local
Computer Vision Projeto 05
Pesquisa aplicada em visão computacional

Manufacturing Defect Detector

Sistema de inspeção industrial com PaDiM e one-class learning, voltado a detectar anomalias sem depender de exemplos de defeitos no treino.

  • PaDiM
  • PyTorch
  • AUC-ROC 0.9968
  • 98% acurácia
GitHub Notebook
Agentes Projeto 06
Projeto autoral

RouteFlow AI

Agente de logística que interpreta pedidos em linguagem natural, aplica otimização de rotas e apresenta visualizações interativas.

  • NLP
  • TSP
  • Geopy
  • Folium
GitHub Demo local
Pesquisa

Pesquisa e artigos

Trabalhos acadêmicos aceitos, separados dos projetos aplicados para deixar claro o contexto de pesquisa, colaboração e publicação prevista.

SBBD 2026 DSW Aguardando Publicação

I Speak Kanoê

I Speak Kanoê: Engineering a Dataset for an Endangered Isolated Language

Coautoria em pesquisa sobre dataset público para a língua indígena Kanoê, com foco em NLP para línguas de baixo recurso, preservação cultural e tecnologias inclusivas. Publicação prevista nos anais do SBBD 2026.

SBBD 2026 Short Papers Aguardando Publicação

Modelos Lexicais Calibrados

Modelos Lexicais Calibrados para Detecção de Ofensividade em Português Brasileiro: um Estudo no ToLD-Br

Pesquisa sobre detecção de ofensividade em português brasileiro, com publicação prevista nos anais do SBBD 2026. O link definitivo será incluído apenas após a publicação oficial.

Publicação em breve
Competências

Competências técnicas

Atuação na construção de soluções com dados, desde a organização da base até modelos, automações e protótipos que possam ser avaliados por métricas.

Machine Learning aplicado

Modelos preditivos e sistemas de decisão com validação, comparação de métricas e atenção ao que o resultado significa para o problema.

  • Scikit-learn
  • XGBoost
  • Avaliação

Processamento de linguagem

Classificação textual, embeddings, preparação de bases e modelos para lidar com linguagem informal, domínios específicos e poucos dados.

  • NLP
  • Transformers
  • Low-resource

IA Generativa

Protótipos com LLMs, RAG e agentes para organizar informação, apoiar análise técnica e reduzir etapas repetitivas de pesquisa.

  • RAG
  • Agentes
  • Structured Outputs

Visão computacional

Análise de imagens, detecção de anomalias e experimentos one-class para cenários em que exemplos de falha são raros ou difíceis de obter.

  • PaDiM
  • PyTorch
  • One-Class

Engenharia de dados

Pipelines locais para ingestão, validação, modelagem analítica e publicação de resultados em APIs ou bases consultáveis.

  • Airflow
  • DuckDB
  • FastAPI

Automação com dados

Rotinas para validar, cruzar e organizar bases. Em experiência operacional, esse tipo de automação reduziu auditoria manual em 80%.

  • SQL
  • Docker
  • Testes/CI