A Resposta Breve
A regra antiga era "para analisar um dado, primeiro copie-o". O Zero Copy, em muitos casos, anula essa premissa: é possível consultar uma tabela que reside em um data warehouse externo sem transferi-la. Esta é uma capacidade real, mas ela troca um tipo de custo por outro – em vez de custo de armazenamento e pipeline, obtém-se custo de processamento e dependência da disponibilidade da fonte.
A decisão correta é tratá-la como qualquer decisão de arquitetura: baseada em requisitos de uso, não em modismos.
Quatro Parâmetros Decisivos
| Parâmetro | Pendendo para Zero Copy | Pendendo para Ingestion |
|---|---|---|
| Freshness | Dados mais atualizados são sempre necessários | Ciclos agendados são suficientes |
| Desempenho | Análise e segmentação, tolerância a segundos | Operação em tempo real, tempo de resposta constante |
| Volume e Frequência | Grande volume, poucas consultas | Volume médio, muitas consultas |
| Governança | A fonte mantém uma política robusta | Controle total sobre a cópia é necessário |
Esta tabela também explica por que a maioria das organizações adota uma abordagem híbrida: fluxos operacionais são ingeridos, enquanto fluxos analíticos pesados permanecem no local.
O Que Permanece sob a Responsabilidade da Equipe, Mesmo com Zero Copy
O acesso virtual remove o pipeline, não o trabalho. Ainda são necessários: mapeamento de esquema para o modelo comum, decisão sobre chaves de identificação para unificação de perfil, tratamento de mudanças de esquema na origem e monitoramento de disponibilidade. Uma mudança no nome de uma coluna no data warehouse externo quebrará a visualização virtual, assim como quebraria um ETL.
Portanto, o acordo com a equipe de dados que mantém a fonte é parte da implementação: aviso prévio sobre mudanças de esquema, janela de manutenção conhecida e orçamento de consultas acordado.
Padrões Híbridos Eficazes
Resumo para dentro, detalhe para fora – Valores resumidos por cliente são inseridos na camada de unificação, e as linhas de detalhe são mantidas no data warehouse para acesso sob demanda. Este é o padrão mais comum e geralmente o mais econômico.
Janela quente e arquivo frio – Os últimos 12 a 24 meses são copiados internamente para desempenho, e o histórico mais antigo permanece acessível virtualmente.
Virtual primeiro, cópia conforme necessidade – Começa-se com acesso virtual, mede-se a frequência de uso real e copia-se apenas o que se provou ser frequentemente necessário. Esta é a maneira eficiente de evitar a cópia de dados que ninguém consultará.
A relação entre esta decisão e a divisão de responsabilidades entre sistemas é detalhada em Data 360 vs. Dados de CRM e Fonte da Verdade na Organização.
Cenário: Empresa Financeira com 400 Milhões de Linhas
Uma empresa de serviços financeiros desejava segmentação de clientes baseada em histórico transacional de sete anos – aproximadamente 400 milhões de linhas em um data warehouse na nuvem. O plano original era a ingestão completa na camada de unificação.
O piloto mudou a decisão. Foi medido que as segmentações reais dependiam de apenas três cálculos – média mensal, tendência de 90 dias e classificação de atividade – e todos poderiam ser calculados no próprio data warehouse. Em vez de transferir 400 milhões de linhas, foram transferidas três colunas resumidas por cliente, atualizadas diariamente, enquanto os detalhes permaneceram virtualmente acessíveis para investigação pontual.
O que foi decidido aqui não foi "virtual vs. cópia", mas sim o nível de granularidade: a pergunta correta era qual resolução de dados era realmente necessária. Ao respondê-la, a questão da cópia se tornou insignificante.
Riscos Comuns e Ações Preventivas
| Risco | Como se manifesta na prática | Ação Preventiva |
|---|---|---|
| Custo de processamento surpreendente | Consultas amplas com alta frequência | Medição em piloto e acordo prévio |
| Dependência da disponibilidade da fonte | Falha no data warehouse desativa segmentação | Fallback ou janela quente copiada |
| Mudanças de esquema | Visualizações quebram sem aviso | Acordo de modificação e monitoramento de esquema |
| Permissões indefinidas | Exposição mais ampla do que na fonte | Identidade da consulta e política de exposição documentada |
| Granularidade incorreta | Transferência de detalhes que ninguém usa | Decidir a resolução antes do método |
Como Medir o Sucesso
| Área | O Que Medir | Frequência de Verificação |
|---|---|---|
| Desempenho | Tempo de resposta para consultas de segmentação chave | Mensal |
| Custo | Custo de processamento e tráfego por Use Case | Mensal |
| Estabilidade | Falhas de consulta e disponibilidade da fonte | Semanal |
| Valor | Segmentações e ações geradas efetivamente | Trimestral |
A escolha entre acesso virtual e ingestão é feita no âmbito dos Serviços de Integrações e Dados.
Checklist para a Decisão de Zero Copy
- ☐ Casos de uso concretos definidos e não uma "capacidade geral"
- ☐ Requisito de freshness estabelecido para cada Use Case
- ☐ Resolução dos dados necessária verificada na prática
- ☐ Frequência da consulta e volume de varredura estimados
- ☐ Acordo de mudanças de esquema com o proprietário da fonte existente
- ☐ Identidade da consulta e política de exposição definidas
- ☐ Padrão híbrido considerado antes de uma decisão binária
- ☐ Plano de fallback para falha da fonte existente
- ☐ Piloto medido antes da expansão
- ☐ Proprietário para monitoramento de custos e revisão periódica
Fontes Profissionais
- Salesforce Data 360 — https://www.salesforce.com/data/
- Salesforce Data 360 Architecture — https://architect.salesforce.com/docs/architect/fundamentals/guide/data-360-architecture.html
- HPI Pro – Integrações e Dados — https://hpi.pro/integrations-data
