Felipe dos Santos Miranda

Felipe dos Santos Miranda

Engenheiro DevOps / Platform / SRE Sênior · MLOps · AIOps · GenAI/LLMOps

Construo e opero infraestrutura cloud-native em que times conseguem confiar — e, mais recentemente, as plataformas que colocam machine learning e LLMs em produção. Treze anos passando por big tech, banco de investimento, telco 5G e produtos de IA: da migração do billing core de uma telco global para fora do mainframe, à responsabilidade por ciclos de vida de ML ponta a ponta, até AIOps agêntico rodando em produção.

CARGO
DevOps / Platform / SRE — Sênior
EXPERIÊNCIA
13+ anos
FOCO
Platform · MLOps · AIOps · GenAI
CLOUDS
AWS · Google Cloud · Azure
ATUALMENTE
System Engineer @ Apple
LOCALIZAÇÃO
Brasil — remoto global
IDIOMAS
PT nativo · EN profissional
STATUS
Aberto a oportunidades

O que eu faço

Quatro áreas onde eu vou fundo. As duas primeiras são onde mora a maioria dos engenheiros DevOps; as duas últimas são onde eu gasto meu tempo hoje.

Platform Engineering

Construir o caminho pavimentado para que os outros times entreguem sem abrir chamado.

  • Ambientes reprodutíveis e auditáveis com Terraform, Ansible e cloud-init
  • Entrega GitOps com Flux e Argo CD reconciliando aplicações no Kubernetes
  • CI/CD em GitLab CI, GitHub Actions e Jenkins
  • Ferramentas self-service que tiram gente do caminho crítico
  • Terraform
  • Kubernetes
  • Flux
  • Argo CD
  • GitLab CI
  • Helm

Confiabilidade & Observabilidade

Instrumentar o sistema antes do incidente, não durante.

  • Prometheus, Grafana, Alertmanager e tracing distribuído com OpenTelemetry
  • Alta disponibilidade e disaster recovery em sistemas de missão crítica
  • Resposta a incidentes e postmortems que mudam o sistema, não a pessoa
  • Otimização de custos como questão de confiabilidade, não como puxadinho
  • Prometheus
  • Grafana
  • OpenTelemetry
  • AWS X-Ray
  • Sentry
  • ELK

MLOps

Ser dono do caminho entre o modelo que funciona e o modelo que atende.

  • Ciclo de vida de ML ponta a ponta: processamento de dados, treino, tuning e deploy
  • Pipelines no AWS SageMaker e AWS IoT Greengrass para inferência em edge
  • Visão computacional em produção — PyTorch, YOLOv8, OpenCV
  • Tratar modelo como artefato de deploy, com o mesmo rigor de um serviço
  • SageMaker
  • PyTorch
  • YOLOv8
  • OpenCV
  • IoT Greengrass

AIOps & GenAI

Workflows agênticos ligados a CI/CD e monitoramento — rodando em produção hoje.

  • AIOps agêntico no SDK da Anthropic que investiga alertas automaticamente
  • Detecção proativa de problemas antes do pager tocar
  • Liderança na adoção de LLM no ciclo de desenvolvimento — skills, subagents e hooks
  • Design orientado a RAG e práticas de LLMOps para embarcar modelos em produtos
  • Anthropic Claude SDK
  • LLMOps
  • RAG
  • Python
  • CI/CD agêntico

Impacto em produção

Três projetos em que o número é a história. Todos rodaram em produção, sob restrição real.

Vodafone

O serviço de emergência 999 do Reino Unido, reconstruído para 5G

  • ~1.000–2.000 ms <100 ms

    Tempo de reroteamento da chamada de emergência

  • <10 s

    Resposta do AML (Advanced Mobile Location)

Um sistema de missão crítica e altamente regulado, onde um reroteamento lento é uma pessoa esperando ambulância. Desenhei a arquitetura Kubernetes de ponta a ponta — não-produtivo e produção — e containerizei a stack legada, escrevendo todos os manifests e um Helm chart por microsserviço.

Construí do zero os pipelines de CI/CD e todo o toolchain de entrega — Jenkins, Nexus, GitLab e Argo CD — além de observabilidade e tracing distribuído com Prometheus, Grafana, Alertmanager e OpenTelemetry.

  • Kubernetes
  • Helm
  • Argo CD
  • OpenTelemetry
  • 5G
  • Regulado
Vodafone

Provisionamento self-service de VMs para toda a engenharia

  • ~2 semanas instantâneo

    Tempo de provisionamento, após aprovação

Provisionar uma máquina virtual significava abrir chamado e esperar cerca de duas semanas. Desenhei e construí a plataforma que eliminou a fila.

Um portal Node.js/Angular na frente de Terraform, Jenkins, cloud-init e automação em Python — a aprovação seguiu sendo decisão humana; tudo depois dela deixou de ser.

  • Terraform
  • Jenkins
  • cloud-init
  • Node.js
  • Self-service
IBM

O billing core de uma telco global, para fora do mainframe

  • Mainframe / COBOL Linux / Java

    Plataforma de billing core

  • 600+

    Servidores Red Hat Linux operados em vSphere

A maior aplicação de billing de uma telco global norte-americana, rodando em Mainframe e COBOL. Trabalhei na migração para Linux e Java enquanto operava o parque em que ela rodava.

Parques de produção e desenvolvimento em vSphere ao lado de Mainframe MVS, com Jenkins, Docker, Terraform e Chef para entrega e configuração.

  • Linux
  • Java
  • COBOL
  • vSphere
  • Terraform
  • Chef

Como eu trabalho

  • automatizar_em_vez_de_repetir true

    Se doeu duas vezes, vira pipeline. Trabalho manual é um bug report sobre a plataforma.

  • infraestrutura_como_codigo sempre

    Nada chega em produção sem estar versionado, revisável e reprodutível.

  • observabilidade_primeiro true

    Instrumentar antes do incidente. Depurar às cegas às 3h da manhã é uma escolha feita meses antes.

  • dono_do_codigo_e_da_infra true

    Time horizontal funciona. Quem escreve o serviço precisa conseguir operar o serviço.

  • postmortem_sem_culpado true

    A falha está no sistema, não na pessoa. Caso contrário, ninguém mais reporta o quase-incidente.

  • ia_como_alavanca true

    LLM tira trabalho repetitivo do caminho. Não substitui julgamento, e eu não finjo que substitui.

Experiência

System Engineer Apple

jun 2025 – Presente Cupertino, CA · Remoto

Construção e operação de plataformas internas cloud-native na interseção entre DevOps, Cloud e IA Generativa aplicada, em um time horizontal onde cada engenheiro é dono do código e da infraestrutura.

  • Construo e opero a infraestrutura AWS que sustenta plataformas e serviços internos; gerencio IaC com Terraform para ambientes reprodutíveis e auditáveis.
  • Desenho e opero CI/CD em GitLab CI e GitHub Actions com entrega contínua baseada em GitOps (Flux) reconciliando aplicações no Kubernetes (EKS).
  • Implemento monitoramento e observabilidade — AWS Managed Prometheus & Grafana, X-Ray, Sentry — para manter sistemas críticos confiáveis e altamente disponíveis.
  • Lidero a adoção de LLM / GenAI no ciclo de desenvolvimento, criando e compartilhando Claude skills, subagents e hooks; atuo como especialista de LLM/GenAI do time para embarcar LLMs em produção.
  • Pioneirismo em AIOps com workflows agênticos no SDK da Anthropic integrados a CI/CD e monitoramento, automatizando a investigação de alertas e a detecção proativa de incidentes.
Stack
  • AWS
  • Kubernetes (EKS)
  • Terraform
  • GitOps (Flux)
  • GitLab CI
  • GitHub Actions
  • Prometheus
  • Grafana
  • X-Ray
  • Sentry
  • Python
  • Django
  • Anthropic Claude SDK

DevOps / MLOps Engineer CellarEye

mar 2023 – jun 2025 Califórnia, EUA · Remoto

Responsável pelo caminho do modelo à produção em um time de Visão Computacional construindo um app com IA que digitaliza a gestão de adegas (900+ garrafas por colecionador).

  • Construí o ciclo de vida de ML de ponta a ponta — processamento de dados em PyTorch, detecção de objetos com YOLOv8, processamento de imagem com OpenCV — para reconhecimento de garrafas em tempo real.
  • Implementei MLOps no AWS SageMaker (treino, tuning, deploy) e AWS IoT Greengrass para inferência em edge / on-device.
  • Desenhei CI/CD e geri Kubernetes na AWS para entrega de backend e app iOS; operei a infraestrutura com foco em escalabilidade, segurança, alta disponibilidade e disaster recovery.
Stack
  • Python
  • PyTorch
  • YOLOv8
  • OpenCV
  • AWS SageMaker
  • IoT Greengrass
  • Kubernetes
  • CI/CD
  • MLOps
  • Visão Computacional
  • Edge
  • iOS

DevOps Specialist Vodafone

abr 2021 – mar 2023 Portugal

Migrei o serviço de emergência 999 do Reino Unido para o 5G — reconstruindo e containerizando um sistema crítico e altamente regulado em Kubernetes.

  • Desenhei a arquitetura Kubernetes de ponta a ponta (não-produtivo + produção) para alta disponibilidade e tolerância a falhas; containerizei aplicações legadas com todos os manifests e um Helm chart por microsserviço.
  • Construí do zero os pipelines de CI/CD e o toolchain de entrega (Jenkins, Nexus, GitLab, Argo CD / GitOps); implementei observabilidade e tracing distribuído (Prometheus, Grafana, Alertmanager, OpenTelemetry).
  • Projetei e construí uma plataforma self-service de provisionamento de VMs — portal Node.js/Angular sobre Terraform, Jenkins, cloud-init e Python.

Impacto Reduzi o reroteamento da chamada de emergência de ~1.000–2.000 ms para menos de 100 ms, levei a resposta do AML para menos de 10 segundos e reduzi o provisionamento de VMs de ~2 semanas para instantâneo após aprovação.

Stack
  • Kubernetes
  • Helm
  • Terraform
  • Jenkins
  • GitLab
  • Argo CD
  • cloud-init
  • Python
  • Prometheus
  • Grafana
  • OpenTelemetry
  • Elasticsearch
  • Redis
  • vSphere

DevOps Engineer TempoTem

jun 2020 – abr 2021 Barueri, São Paulo, Brasil

Construí e operei ambientes de e-commerce de alta disponibilidade, 100% cloud-native na AWS.

  • Operei o parque AWS completo — EC2, S3, RDS, DynamoDB, Route 53, Lambda, CloudFront, CloudFormation e EKS — com Jenkins, Bitbucket, Prometheus, Grafana e Magento.
Stack
  • AWS
  • EKS
  • CloudFormation
  • Jenkins
  • Bitbucket
  • Prometheus
  • Grafana
  • Magento

DevOps Engineer Veloe

fev 2019 – jun 2020 Barueri, São Paulo, Brasil

Operei ambiente de produção 100% AWS para aplicações Java, Node.js, React e Python.

  • Entrega e monitoramento com Azure DevOps, EKS, Docker, CloudFormation, Dynatrace e CloudFront.
Stack
  • AWS
  • EKS
  • Docker
  • Azure DevOps
  • CloudFormation
  • Dynatrace
  • CloudFront

DevOps Engineer BTG Pactual

mai 2018 – fev 2019 São Paulo, Brasil

Introduzi a cultura DevOps e construí arquiteturas para sistemas internos de alta disponibilidade em um dos maiores bancos de investimento da América Latina; 100% cloud-native na AWS.

  • AWS (EC2, S3, RDS, DynamoDB, Route 53, Lambda, CloudFront, CloudFormation, EKS) com Jenkins, GitHub Enterprise, Prometheus e Grafana.
Stack
  • AWS
  • EKS
  • CloudFormation
  • Jenkins
  • GitHub Enterprise
  • Prometheus
  • Grafana

DevOps Engineer IBM

ago 2013 – jul 2017 Hortolândia, São Paulo, Brasil

Operei 600+ servidores Red Hat Linux em vSphere (produção e desenvolvimento) além de Mainframe MVS para um grande cliente global de telecom.

  • Projeto-chave: migrei a maior aplicação de billing de uma telco global norte-americana de Mainframe/COBOL para Linux/Java.
  • Entrega e configuração com Jenkins, Docker, Terraform e Chef; Java e Micro Focus COBOL.
Stack
  • Red Hat Linux
  • vSphere
  • Mainframe MVS
  • Jenkins
  • Docker
  • Terraform
  • Chef
  • Java
  • COBOL

System Administrator Experiência anterior

2008 – 2013 Brasil / Portugal

Manzano Pneumáticos, Concrete Solutions, Novo Motor e Credimais — administração de servidores Linux, redes e firewall (proxy Squid, VPN, Active Directory), tuning de performance Apache/Magento e deploys de portais web em AWS EC2.

Stack
  • Linux
  • Apache
  • Squid
  • VPN
  • Active Directory
  • AWS EC2

Competências

Cloud

  • AWS
  • EKS
  • EC2
  • RDS
  • MSK
  • OpenSearch
  • ElastiCache
  • SageMaker
  • IoT Greengrass
  • CloudWatch
  • X-Ray
  • Google Cloud
  • Azure

Containers & Orquestração

  • Kubernetes
  • Helm
  • Docker
  • OpenShift

Infraestrutura como Código

  • Terraform
  • Ansible
  • CloudFormation
  • cloud-init

CI/CD & GitOps

  • GitLab CI
  • GitHub Actions
  • Jenkins
  • Argo CD
  • Flux

Observabilidade

  • Prometheus
  • Grafana
  • Alertmanager
  • OpenTelemetry
  • AWS X-Ray
  • Sentry
  • ELK / Elasticsearch

MLOps / AIOps / GenAI

  • AWS SageMaker
  • PyTorch
  • Deploy de modelos
  • Workflows agênticos (Anthropic Claude SDK)
  • LLMOps
  • Design orientado a RAG

Programação

  • Python
  • Bash
  • JavaScript / Node.js

Bancos de Dados

  • PostgreSQL / RDS
  • DynamoDB
  • Redis
  • Elasticsearch
  • MongoDB

Práticas

  • SRE
  • Alta disponibilidade
  • Disaster recovery
  • Resposta a incidentes
  • Otimização de custos

Certificações

  • AI Fluency for Builders — Anthropic
  • AI Fluency for Students — Anthropic
  • Teaching the AI Fluency Framework
  • AI Capabilities and Limitations
  • Introduction to Claude Cowork
  • Big Data — Fundamentos

15 certificações no total — lista completa disponível no LinkedIn.

Formação

  • Ciência da Computação

    IBTA — Instituto Brasileiro de Tecnologia Avançada

    2009

Idiomas

  • Português Nativo
  • Inglês Profissional
  • Espanhol Básico

Vamos conversar