Construo e opero infraestrutura cloud-native em que times conseguem confiar — e, mais recentemente, as plataformas que colocam machine learning e LLMs em produção. Treze anos passando por big tech, banco de investimento, telco 5G e produtos de IA: da migração do billing core de uma telco global para fora do mainframe, à responsabilidade por ciclos de vida de ML ponta a ponta, até AIOps agêntico rodando em produção.
CARGO
DevOps / Platform / SRE — Sênior
EXPERIÊNCIA
13+ anos
FOCO
Platform · MLOps · AIOps · GenAI
CLOUDS
AWS · Google Cloud · Azure
ATUALMENTE
System Engineer @ Apple
LOCALIZAÇÃO
Brasil — remoto global
IDIOMAS
PT nativo · EN profissional
STATUS
Aberto a oportunidades
$ cat especialidades.md
# O que eu faço
Quatro áreas onde eu vou fundo. As duas primeiras são onde mora a maioria dos engenheiros DevOps; as duas últimas são onde eu gasto meu tempo hoje.
Platform Engineering
Construir o caminho pavimentado para que os outros times entreguem sem abrir chamado.
Ambientes reprodutíveis e auditáveis com Terraform, Ansible e cloud-init
Entrega GitOps com Flux e Argo CD reconciliando aplicações no Kubernetes
CI/CD em GitLab CI, GitHub Actions e Jenkins
Ferramentas self-service que tiram gente do caminho crítico
Terraform
Kubernetes
Flux
Argo CD
GitLab CI
Helm
Confiabilidade & Observabilidade
Instrumentar o sistema antes do incidente, não durante.
Prometheus, Grafana, Alertmanager e tracing distribuído com OpenTelemetry
Alta disponibilidade e disaster recovery em sistemas de missão crítica
Resposta a incidentes e postmortems que mudam o sistema, não a pessoa
Otimização de custos como questão de confiabilidade, não como puxadinho
Prometheus
Grafana
OpenTelemetry
AWS X-Ray
Sentry
ELK
MLOps
Ser dono do caminho entre o modelo que funciona e o modelo que atende.
Ciclo de vida de ML ponta a ponta: processamento de dados, treino, tuning e deploy
Pipelines no AWS SageMaker e AWS IoT Greengrass para inferência em edge
Visão computacional em produção — PyTorch, YOLOv8, OpenCV
Tratar modelo como artefato de deploy, com o mesmo rigor de um serviço
SageMaker
PyTorch
YOLOv8
OpenCV
IoT Greengrass
AIOps & GenAI
Workflows agênticos ligados a CI/CD e monitoramento — rodando em produção hoje.
AIOps agêntico no SDK da Anthropic que investiga alertas automaticamente
Detecção proativa de problemas antes do pager tocar
Liderança na adoção de LLM no ciclo de desenvolvimento — skills, subagents e hooks
Design orientado a RAG e práticas de LLMOps para embarcar modelos em produtos
Anthropic Claude SDK
LLMOps
RAG
Python
CI/CD agêntico
$ grep -r "impacto" ./experiencia
# Impacto em produção
Três projetos em que o número é a história. Todos rodaram em produção, sob restrição real.
Vodafone
O serviço de emergência 999 do Reino Unido, reconstruído para 5G
~1.000–2.000 ms
→
<100 ms
Tempo de reroteamento da chamada de emergência
<10 s
Resposta do AML (Advanced Mobile Location)
Um sistema de missão crítica e altamente regulado, onde um reroteamento lento é uma pessoa esperando ambulância. Desenhei a arquitetura Kubernetes de ponta a ponta — não-produtivo e produção — e containerizei a stack legada, escrevendo todos os manifests e um Helm chart por microsserviço.
Construí do zero os pipelines de CI/CD e todo o toolchain de entrega — Jenkins, Nexus, GitLab e Argo CD — além de observabilidade e tracing distribuído com Prometheus, Grafana, Alertmanager e OpenTelemetry.
Kubernetes
Helm
Argo CD
OpenTelemetry
5G
Regulado
Vodafone
Provisionamento self-service de VMs para toda a engenharia
~2 semanas
→
instantâneo
Tempo de provisionamento, após aprovação
Provisionar uma máquina virtual significava abrir chamado e esperar cerca de duas semanas. Desenhei e construí a plataforma que eliminou a fila.
Um portal Node.js/Angular na frente de Terraform, Jenkins, cloud-init e automação em Python — a aprovação seguiu sendo decisão humana; tudo depois dela deixou de ser.
Terraform
Jenkins
cloud-init
Node.js
Self-service
IBM
O billing core de uma telco global, para fora do mainframe
Mainframe / COBOL
→
Linux / Java
Plataforma de billing core
600+
Servidores Red Hat Linux operados em vSphere
A maior aplicação de billing de uma telco global norte-americana, rodando em Mainframe e COBOL. Trabalhei na migração para Linux e Java enquanto operava o parque em que ela rodava.
Parques de produção e desenvolvimento em vSphere ao lado de Mainframe MVS, com Jenkins, Docker, Terraform e Chef para entrega e configuração.
Linux
Java
COBOL
vSphere
Terraform
Chef
$ cat ~/.config/principios.toml
# Como eu trabalho
automatizar_em_vez_de_repetir
=
true
Se doeu duas vezes, vira pipeline. Trabalho manual é um bug report sobre a plataforma.
infraestrutura_como_codigo
=
sempre
Nada chega em produção sem estar versionado, revisável e reprodutível.
observabilidade_primeiro
=
true
Instrumentar antes do incidente. Depurar às cegas às 3h da manhã é uma escolha feita meses antes.
dono_do_codigo_e_da_infra
=
true
Time horizontal funciona. Quem escreve o serviço precisa conseguir operar o serviço.
postmortem_sem_culpado
=
true
A falha está no sistema, não na pessoa. Caso contrário, ninguém mais reporta o quase-incidente.
ia_como_alavanca
=
true
LLM tira trabalho repetitivo do caminho. Não substitui julgamento, e eu não finjo que substitui.
$ git log --author="Felipe Miranda"
# Experiência
System Engineer @Apple
jun 2025 – Presente·Cupertino, CA · Remoto
Construção e operação de plataformas internas cloud-native na interseção entre DevOps, Cloud e IA Generativa aplicada, em um time horizontal onde cada engenheiro é dono do código e da infraestrutura.
Construo e opero a infraestrutura AWS que sustenta plataformas e serviços internos; gerencio IaC com Terraform para ambientes reprodutíveis e auditáveis.
Desenho e opero CI/CD em GitLab CI e GitHub Actions com entrega contínua baseada em GitOps (Flux) reconciliando aplicações no Kubernetes (EKS).
Implemento monitoramento e observabilidade — AWS Managed Prometheus & Grafana, X-Ray, Sentry — para manter sistemas críticos confiáveis e altamente disponíveis.
Lidero a adoção de LLM / GenAI no ciclo de desenvolvimento, criando e compartilhando Claude skills, subagents e hooks; atuo como especialista de LLM/GenAI do time para embarcar LLMs em produção.
Pioneirismo em AIOps com workflows agênticos no SDK da Anthropic integrados a CI/CD e monitoramento, automatizando a investigação de alertas e a detecção proativa de incidentes.
Stack
AWS
Kubernetes (EKS)
Terraform
GitOps (Flux)
GitLab CI
GitHub Actions
Prometheus
Grafana
X-Ray
Sentry
Python
Django
Anthropic Claude SDK
DevOps / MLOps Engineer @CellarEye
mar 2023 – jun 2025·Califórnia, EUA · Remoto
Responsável pelo caminho do modelo à produção em um time de Visão Computacional construindo um app com IA que digitaliza a gestão de adegas (900+ garrafas por colecionador).
Construí o ciclo de vida de ML de ponta a ponta — processamento de dados em PyTorch, detecção de objetos com YOLOv8, processamento de imagem com OpenCV — para reconhecimento de garrafas em tempo real.
Implementei MLOps no AWS SageMaker (treino, tuning, deploy) e AWS IoT Greengrass para inferência em edge / on-device.
Desenhei CI/CD e geri Kubernetes na AWS para entrega de backend e app iOS; operei a infraestrutura com foco em escalabilidade, segurança, alta disponibilidade e disaster recovery.
Stack
Python
PyTorch
YOLOv8
OpenCV
AWS SageMaker
IoT Greengrass
Kubernetes
CI/CD
MLOps
Visão Computacional
Edge
iOS
DevOps Specialist @Vodafone
abr 2021 – mar 2023·Portugal
Migrei o serviço de emergência 999 do Reino Unido para o 5G — reconstruindo e containerizando um sistema crítico e altamente regulado em Kubernetes.
Desenhei a arquitetura Kubernetes de ponta a ponta (não-produtivo + produção) para alta disponibilidade e tolerância a falhas; containerizei aplicações legadas com todos os manifests e um Helm chart por microsserviço.
Construí do zero os pipelines de CI/CD e o toolchain de entrega (Jenkins, Nexus, GitLab, Argo CD / GitOps); implementei observabilidade e tracing distribuído (Prometheus, Grafana, Alertmanager, OpenTelemetry).
Projetei e construí uma plataforma self-service de provisionamento de VMs — portal Node.js/Angular sobre Terraform, Jenkins, cloud-init e Python.
Impacto Reduzi o reroteamento da chamada de emergência de ~1.000–2.000 ms para menos de 100 ms, levei a resposta do AML para menos de 10 segundos e reduzi o provisionamento de VMs de ~2 semanas para instantâneo após aprovação.
Stack
Kubernetes
Helm
Terraform
Jenkins
GitLab
Argo CD
cloud-init
Python
Prometheus
Grafana
OpenTelemetry
Elasticsearch
Redis
vSphere
DevOps Engineer @TempoTem
jun 2020 – abr 2021·Barueri, São Paulo, Brasil
Construí e operei ambientes de e-commerce de alta disponibilidade, 100% cloud-native na AWS.
Operei o parque AWS completo — EC2, S3, RDS, DynamoDB, Route 53, Lambda, CloudFront, CloudFormation e EKS — com Jenkins, Bitbucket, Prometheus, Grafana e Magento.
Stack
AWS
EKS
CloudFormation
Jenkins
Bitbucket
Prometheus
Grafana
Magento
DevOps Engineer @Veloe
fev 2019 – jun 2020·Barueri, São Paulo, Brasil
Operei ambiente de produção 100% AWS para aplicações Java, Node.js, React e Python.
Entrega e monitoramento com Azure DevOps, EKS, Docker, CloudFormation, Dynatrace e CloudFront.
Stack
AWS
EKS
Docker
Azure DevOps
CloudFormation
Dynatrace
CloudFront
DevOps Engineer @BTG Pactual
mai 2018 – fev 2019·São Paulo, Brasil
Introduzi a cultura DevOps e construí arquiteturas para sistemas internos de alta disponibilidade em um dos maiores bancos de investimento da América Latina; 100% cloud-native na AWS.
AWS (EC2, S3, RDS, DynamoDB, Route 53, Lambda, CloudFront, CloudFormation, EKS) com Jenkins, GitHub Enterprise, Prometheus e Grafana.
Stack
AWS
EKS
CloudFormation
Jenkins
GitHub Enterprise
Prometheus
Grafana
DevOps Engineer @IBM
ago 2013 – jul 2017·Hortolândia, São Paulo, Brasil
Operei 600+ servidores Red Hat Linux em vSphere (produção e desenvolvimento) além de Mainframe MVS para um grande cliente global de telecom.
Projeto-chave: migrei a maior aplicação de billing de uma telco global norte-americana de Mainframe/COBOL para Linux/Java.
Entrega e configuração com Jenkins, Docker, Terraform e Chef; Java e Micro Focus COBOL.
Stack
Red Hat Linux
vSphere
Mainframe MVS
Jenkins
Docker
Terraform
Chef
Java
COBOL
System Administrator @Experiência anterior
2008 – 2013·Brasil / Portugal
Manzano Pneumáticos, Concrete Solutions, Novo Motor e Credimais — administração de servidores Linux, redes e firewall (proxy Squid, VPN, Active Directory), tuning de performance Apache/Magento e deploys de portais web em AWS EC2.
Stack
Linux
Apache
Squid
VPN
Active Directory
AWS EC2
$ ls -1 ./competencias
# Competências
Cloud
AWS
EKS
EC2
RDS
MSK
OpenSearch
ElastiCache
SageMaker
IoT Greengrass
CloudWatch
X-Ray
Google Cloud
Azure
Containers & Orquestração
Kubernetes
Helm
Docker
OpenShift
Infraestrutura como Código
Terraform
Ansible
CloudFormation
cloud-init
CI/CD & GitOps
GitLab CI
GitHub Actions
Jenkins
Argo CD
Flux
Observabilidade
Prometheus
Grafana
Alertmanager
OpenTelemetry
AWS X-Ray
Sentry
ELK / Elasticsearch
MLOps / AIOps / GenAI
AWS SageMaker
PyTorch
Deploy de modelos
Workflows agênticos (Anthropic Claude SDK)
LLMOps
Design orientado a RAG
Programação
Python
Bash
JavaScript / Node.js
Bancos de Dados
PostgreSQL / RDS
DynamoDB
Redis
Elasticsearch
MongoDB
Práticas
SRE
Alta disponibilidade
Disaster recovery
Resposta a incidentes
Otimização de custos
$ ls ./certificacoes
# Certificações
AI Fluency for Builders — Anthropic
AI Fluency for Students — Anthropic
Teaching the AI Fluency Framework
AI Capabilities and Limitations
Introduction to Claude Cowork
Big Data — Fundamentos
15 certificações no total — lista completa disponível no LinkedIn.
$ cat formacao.md
# Formação
Ciência da Computação
IBTA — Instituto Brasileiro de Tecnologia Avançada