Consultoria técnica · GenAI e dados

Consultoria em GenAI e dados que aguenta produção.

POC bonito é fácil. Pipeline RAG com custo previsível, latência sob controle e qualidade auditável é outra história. É nessa segunda parte que eu entro.

Mais de 15 anos construindo sistemas escaláveis. Hoje CTO da Harmo, plataforma AI-first que roda LLMs, embeddings e RAG em produção multi-tenant todo dia.

O que passa a ser medido

instrumentado
recall@ko retrieval trouxe mesmo o documento certo
0–1
faithfulnessa resposta se sustenta no contexto recuperado
0–1
custo / requisiçãoprompt, output e embedding somados
USD
latência p99o pior caso que o seu usuário sente
ms
consumo por tenantquem gasta o quê, com rateio defensável
USD/mês

Nenhum desses números existe antes de alguém instalar. Enquanto não existem, qualidade de IA é opinião e custo é surpresa no fim do mês.

15+ anos em engenharia CTO & co-founder na Harmo Antônio Carlos, SC · remoto github linkedin blog

Escopos

Seis frentes, um critério: tem que rodar depois que eu sair.

Cada frente tem uma página própria com o detalhe técnico do que entra, o que não entra e como se mede.

Consultoria em IA & GenAI

Pipelines RAG do ingest ao reranking, escolha de modelo com matriz de tradeoff e avaliação automática rodando em CI.

  • Arquitetura de sistemas de IA
  • Implementação de RAG pipelines
  • Prompt engineering
  • OpenAI, Gemini, Claude, open-source
Ver detalhe

Engenharia de Dados

Pipelines que não quebram em silêncio: ingestão, ETL, particionamento e observabilidade de dado, não só de máquina.

  • Pipelines de dados com Airflow
  • ETL com Python
  • Ingestão em tempo real
  • Arquiteturas de dados multi-tenant
Ver detalhe

Arquitetura de Software

Decisão de arquitetura com o custo escrito ao lado. Microserviços quando resolve, monólito quando é honesto.

  • Microserviços em Golang
  • Arquiteturas event-driven
  • Sistemas distribuídos
  • Otimização de performance
Ver detalhe

Cloud & DevOps

Infra como código, cluster que escala sem susto e conta da AWS que alguém consegue explicar linha a linha.

  • AWS (EKS, Lambda, Step Functions)
  • Kubernetes
  • Infraestrutura como código
  • Arquiteturas serverless
Ver detalhe

Mentoria Tech

Sessão recorrente com engenheiro ou squad, revisão de código e arquitetura, e as conversas de carreira que ninguém tem.

  • Mentoria individual
  • Treinamento de equipes
  • Revisão de código e arquitetura
  • Boas práticas e padrões
Ver detalhe

Transformação Digital

Modernizar legado sem parar o negócio: migração em fatias, com rollback pensado antes e não durante.

  • Modernização de sistemas
  • Migração para cloud
  • Adoção de IA e automação
  • Estratégia de dados
Ver detalhe

Do primeiro contato ao handoff

Como funciona, com os prazos escritos.

Sem etapa de descoberta cobrada, sem proposta de trinta páginas. O rótulo de cada etapa é o prazo real dela.

  1. dia 0

    Conversa de 30 minutos, sem custo

    Você descreve o problema, as restrições de stack, prazo e orçamento. Eu digo se resolvo, se resolvo parcialmente, ou se você precisa de outro tipo de profissional. Já saí de várias dessas conversas indicando outra pessoa, e tá tudo bem.

  2. até 48h

    Proposta com escopo, prazo e valor

    Um documento curto com o que entra, o que explicitamente não entra, o cronograma e o valor fechado. Projeto com escopo definido, pacote mensal de horas ou hora avulsa pra diagnóstico. Você aprova ou não, sem follow-up chato.

  3. 2 a 12 semanas

    Execução no seu repositório

    Trabalho dentro do repo do cliente, no canal que o time já usa, com commit e PR revisável. Sem caixa-preta e sem entrega de zip no fim. Se o prazo escorregar, você fica sabendo na semana, não no vencimento.

  4. no encerramento

    Handoff e documentação

    Documentação técnica, pareamento com o time interno e os runbooks do que foi construído. O objetivo é o cliente sair menos dependente de mim, não mais. Consultor que cria dependência tá vendendo outra coisa.

Verificável

O que dá pra conferir sem me perguntar nada.

Nada de logo de cliente que não posso citar. O que tem aqui você abre em outra aba e checa agora.

Operação

Harmo, desde 2020

Co-founder e CTO. Plataforma multi-tenant com LLMs, embeddings e pipelines RAG rodando em produção pra varejo físico enterprise. Não é laboratório, é sistema com cliente pagando e SLA.

Ver no LinkedIn

Código

Aberto no GitHub

Projetos open-source e o histórico de commits público. A melhor forma de avaliar um consultor técnico é ler o código dele antes de contratar.

Ver o GitHub

Escrita técnica

Blog com o detalhe feio

Posts sobre crise de performance no Aurora, observabilidade no EKS, worker pools em Go, loop improdutivo em Step Functions. Problema real com número real, não listicle.

Ler no rifeli.dev

Cases de cliente ficam sob NDA e por isso não estão publicados aqui. Na conversa de 30 minutos eu abro os detalhes que o contrato permite e passo referência direta de quem já trabalhou comigo.

Quem assina o trabalho

Leonardo Rifeli

Co-founder e CTO na Harmo, onde lidero estratégia, arquitetura e engenharia de uma plataforma AI-first que transforma dado operacional em decisão usando LLMs, pipelines RAG e arquitetura de dados multi-tenant.

São mais de 15 anos em engenharia de software, pipelines de dados e arquitetura cloud-native. A parte que eu mais gosto é a chata: transformar conjunto de dado bagunçado em coisa acionável com NLP, embeddings e orquestração de LLM, e depois provar que funciona com métrica.

Na Harmo conduzi a virada de analytics operacional pra um motor alimentado por IA, onde marcas conversam com o próprio dado em linguagem natural, geram relatório dinâmico, configuram notificação inteligente e chegam no insight em segundos. Isso significa que os problemas que você tem eu provavelmente já levei na cara.

Moro na área rural de Antônio Carlos, no sul do Brasil, equilibrando a vida de construtor, pai de família e eterno aprendiz. Atendo remoto, em português ou inglês.

"Construa tecnologia que escuta, aprende e age, para pessoas que importam."
15+ Anos de experiência
2 Startups fundadas
12+ Engenheiros liderados
2 Idiomas de atendimento

Stack

Tecnologia que eu opero, não que eu li sobre.

Tudo aqui já passou por produção com tráfego real e conta da AWS chegando no fim do mês.

GenAI e sistemas de IA

RAG pipelines Embeddings (pgvector) Prompt engineering LangChain LangGraph OpenAI Gemini Claude DeepSeek

Engenharia de dados

Airflow (MWAA) Python ETL Ingestão em tempo real Sumarização de texto Geração automatizada de insights

Backend e infraestrutura

Golang APIs Microserviços Kubernetes Redis PostgreSQL OpenSearch

Cloud-native

AWS EKS AWS Lambda Step Functions Aurora Arquitetura event-driven Multi-tenant seguro

Perguntas frequentes

O que sempre perguntam antes de fechar.

O que é consultoria em GenAI e quando preciso contratar?

Consultoria em GenAI cobre desenho e implementação de soluções com LLMs, pipelines RAG, embeddings e integração com modelos como OpenAI, Gemini e Claude. Faz sentido quando o time precisa entregar valor com IA generativa em produção e não tem experiência consolidada em arquitetura desses sistemas, tradeoffs de custo/latência ou avaliação de qualidade.

Quanto custa implementar uma pipeline RAG?

Depende do volume de documentos, número de fontes, qualidade exigida e se a infra de vetor já existe. Um RAG inicial em produção pode rodar em algumas semanas; arquiteturas multi-tenant, com reranking e avaliação automática, escalam pra meses. O escopo é fechado na primeira conversa de diagnóstico, sem custo.

Qual a diferença entre consultoria e mentoria tech?

Consultoria entrega arquitetura, decisão técnica ou implementação direta no produto do cliente. Mentoria é desenvolvimento contínuo de profissionais ou equipes, com sessões recorrentes, revisão de código e arquitetura, e suporte em decisões de carreira ou liderança técnica.

Quais modelos de engajamento estão disponíveis?

Três formatos: projeto fechado com escopo definido e entrega cravada, pacote mensal de horas pra acompanhamento contínuo, e hora avulsa pra diagnósticos pontuais ou code review. CTO fracional também é possível pra empresas em estágio inicial que precisam de liderança técnica part-time.

Atende clientes fora do Brasil?

Sim. Consultorias e mentorias são remotas via Google Meet ou Zoom, e o atendimento é em português ou inglês. Já trabalhei com times distribuídos em múltiplos fusos horários.

Quanto tempo leva uma consultoria típica?

Diagnósticos curtos saem em uma a duas semanas. Projetos de implementação com escopo médio rodam entre quatro e doze semanas. Engajamentos contínuos como CTO fracional ou mentoria são por trimestre ou semestre.

Como funciona o primeiro contato?

É uma conversa de 30 minutos, sem custo, pra entender o problema, restrições e prazo. Se faz sentido seguir, o próximo passo é uma proposta com escopo, valor e cronograma. Pra agendar, basta preencher o formulário no fim da página.

Próximo passo

Meia hora resolve se faz sentido ou não.

Sem custo, sem proposta empurrada. Você sai com uma leitura técnica honesta do seu problema, mesmo que a resposta seja que você não precisa de mim.

Contato

Me conta o problema.

Quanto mais específico, mais útil a primeira conversa. O envio abre o WhatsApp com a mensagem já montada.

Preenche seu nome.
E-mail inválido.
Escolhe um assunto.
Descreve o problema, mesmo que em duas linhas.

Nada é armazenado neste site. O formulário só monta a mensagem e abre o WhatsApp.

WhatsApp