Conocimiento
Data Product Builder: crea productos de datos con tu coding agent
Escribe lo que necesitas en forma de Data Contract y pide a tu coding agent que lo construya. Implementación en minutos, conforme a tus convenciones e integrada de principio a fin con Entropy Data.
Implementar productos de datos en la era de los coding agents
Seamos honestos: hoy los data engineers construyen productos de datos con coding agents como Claude Code, OpenAI Codex o GitHub Copilot. El agente escribe los modelos dbt, los tests y el workflow de CI. Lo que necesita son tres entradas, y todas se gestionan desde Entropy Data:
- El Data Contract define el qué: el conjunto de datos que el producto de datos debe entregar, especificado desde el punto de vista del Data Consumer.
- El repositorio de skills define el cómo: las convenciones, plantillas y políticas de tu organización para construir productos de datos sobre tu stack.
- El marketplace de datos aporta los datos sobre los que construir: los productos de datos upstream, las aplicaciones de origen y los datos externos que consume el nuevo producto de datos.
El coding agent combina las tres y implementa el producto de datos en minutos: un dataset, un proyecto dbt, un Databricks Asset Bundle, lo que pida tu stack, con tests, workflow de despliegue, data lineage y metadatos incluidos.
Esta página explica los tres bloques (contrato, skills y marketplace) y cómo encajan en el flujo de desarrollo.
El Data Contract define el qué
Un Data Contract describe el producto de datos esperado desde el punto de vista del Data Consumer: el esquema con tipos y semántica, las reglas de calidad, las garantías de actualidad, los SLA y las condiciones de uso. Deja por escrito qué debe entregar el producto de datos, y por eso es la especificación ideal para un coding agent.
Así que el flujo empieza por el contrato, no por el código ni por los datos. Escribe o amplía primero el contrato ODCS, en el editor de Entropy Data, con nuestra plantilla ODCS de Excel o directamente en YAML. Luego entrégaselo al agente para que genere el pipeline de datos, los tests, el workflow de CI y el cableado de data lineage que lo satisfacen.
Por último, ejecuta datacontract test sobre el resultado para comprobar que los datos reales coinciden con la especificación.
En esta página usamos el producto de datos Shelf Warmers como ejemplo recurrente: una lista de artículos en stock sin ventas en los últimos seis meses, propiedad del equipo de fulfillment. Su contrato especifica el SKU, el nombre del artículo y la marca de tiempo de la última venta, con actualización diaria.
El repositorio de skills define el cómo
Un mismo contrato se puede implementar de formas muy distintas: convenciones de nombres, capas de modelos, orquestación, despliegue, requisitos de seguridad. Ese conocimiento es propio de cada organización y vive en un repositorio de skills: un repositorio Git con skills (instrucciones en Markdown que el agente carga para una tarea concreta), plantillas de archivos y hooks de validación.
entropy-data/dataproduct-builder-dbt es la referencia open source para dbt. Haz un fork y codifica tus propias convenciones: cambia la nomenclatura de las capas de modelos, sustituye GitHub Actions por Airflow, añade reglas de lint internas, incorpora tu taxonomía de PII, inserta puntos de control de gobernanza.
El repositorio se enchufa al coding agent mediante su mecanismo de plugins, por ejemplo como plugin de Claude Code, plugin de Codex o vía enrutado con AGENTS.md. Una vez instalado, el agente elige la skill adecuada para cada tarea e implementa el producto de datos en minutos, siguiendo al pie de la letra las políticas y convenciones de tu empresa.
Entropy Data ofrece repositorios de skills open source por stack:
- dataproduct-builder-dbt. dbt sobre cualquier adaptador: Snowflake, BigQuery, Databricks, Redshift, Postgres, DuckDB. GitHub Actions para CI. Integración completa con Entropy Data: ODPS, ODCS, data lineage con OpenLineage y detección de drift.
- dataproduct-builder-databricks. Databricks Asset Bundles con Lakeflow Spark Declarative Pipelines. Compartición vía Unity Catalog. Integración completa con Entropy Data.
- Snowflake Native Apps Framework. Próximamente.
- AWS Glue. Próximamente.
Los repositorios de la comunidad y los personalizados son bienvenidos. Envía un pull request al registro dataproduct-builders para publicar el tuyo.
El marketplace de datos aporta los datos sobre los que construir
Un producto de datos rara vez parte de cero. Consume datos upstream, y el coding agent los encuentra en el marketplace de Entropy Data. A través de la CLI de Entropy Data, el agente busca en todo lo que el marketplace conoce:
- Productos de datos upstream con sus contratos, su semántica y su historial de calidad.
- Aplicaciones de origen, los sistemas operacionales detrás de los productos de datos alineados con la fuente.
- Datos externos disponibles de proveedores comerciales y datos abiertos publicados en el marketplace.
Shelf Warmers necesita el catálogo de artículos actual y los movimientos de stock, así que el agente ejecuta
entropy-data search query "articles stock" -o json
El agente lee los contratos y la semántica de los candidatos y evalúa si son relevantes para el producto de datos que está construyendo: ¿encajan los campos, las claves de unión, las garantías de calidad y las condiciones de uso con los requisitos? Para Shelf Warmers se queda con dos productos de datos upstream: Articles latest, del equipo de producto, para el catálogo de artículos, y Stock Update Events, del equipo de fulfillment, para los movimientos de stock. Ambos pasan a ser Input Ports del nuevo producto de datos (models/input_ports/*.odcs.yaml en la estructura de referencia de dbt), de modo que el data lineage queda cableado desde el primer commit.
Cuando el acceso a una fuente está restringido, el agente da un paso más: solicita el acceso en nombre del nuevo producto de datos consumidor, con la justificación de negocio incluida. Para Shelf Warmers, eso es una solicitud de acceso al Output Port de Articles latest con el propósito «identificar artículos en stock sin ventas en los últimos seis meses». El Data Product Owner ve la solicitud en Entropy Data y la aprueba, o bien una política de gobernanza la aprueba automáticamente según la configuración del producto de datos y su perfil de clasificación de datos.
Bajo el capó
CLI de Entropy Data
La CLI de Entropy Data es el puente entre tu repositorio local y la plataforma Entropy Data. Se conecta a Entropy Data para descubrir productos de datos upstream en el marketplace, recuperar sus contratos y su semántica para entender las claves de unión y las definiciones de campos, actualizar los metadatos y el data lineage de tu producto de datos, y publicar los resultados de los tests de contrato. Instálala una vez por repositorio, autorízala con una API key y las skills de sincronización y publicación la usarán automáticamente.
Elegimos la CLI en lugar de MCP porque es más eficiente en tokens y más sencilla de configurar.
Guía dentro de Entropy Data
Un repositorio Data Product Builder se registra como builder en Entropy Data, en Governance → Data Product Builders. El builder es donde los data engineers definen la experiencia para los equipos que lo van a usar:
- Instrucciones de instalación para los coding agents que la plantilla admite (Claude Code, OpenAI Codex, GitHub Copilot CLI). Los comandos de instalación se generan a partir de la URL del repositorio.
- Prompts de uso con variantes según la fase del ciclo de vida. Un producto de datos en
draftrecibe un prompt de arranque; unoactiverecibe prompts de evolución y de test.
Entropy Data también controla la visibilidad: cada equipo ve unos plugins de Data Product Builder u otros según el arquetipo del producto de datos, el equipo propietario, las etiquetas y el estado. Un equipo que construye un producto alineado con el consumo sobre Databricks ve un builder optimizado para Databricks. Otro que construye un producto alineado con la fuente sobre Snowflake ve un builder de Snowflake. Cada equipo trabaja con el builder que encaja con su stack y sus convenciones.
Skills (ejemplos)
Una skill es un archivo Markdown que el agente carga cuando aparece la tarea correspondiente. Las siete skills siguientes son las que incluye el repositorio de skills de referencia para dbt (entropy-data/dataproduct-builder-dbt); en tu fork puedes añadir, quitar o sustituir cualquiera de ellas.
- datacontract-edit modifica el contrato de un Output Port a partir de una instrucción en lenguaje natural. El contrato sigue siendo el punto de entrada.
- dataproduct-bootstrap genera el esqueleto de un proyecto dbt nuevo:
dbt_project.yml, la estructura de modelos en cuatro capas, README yprofiles.yml.example. - dataproduct-implement lee los contratos de entrada y de salida y escribe los modelos dbt que los cumplen.
- datacontract-test ejecuta
datacontract testsobre los datos reales y devuelve los resultados de esquema y calidad. - dataproduct-exampledata extrae filas de muestra, elimina las columnas marcadas como PII en el contrato y sube la muestra depurada a Entropy Data.
- entropy-data-sync toma un proyecto dbt existente, lo alinea con la estructura de referencia, configura el workflow de despliegue y sincroniza los metadatos de ODPS, ODCS y data lineage.
- entropy-data-teams lista los equipos configurados en tu tenant para que el agente pueda pedir al usuario que elija un owner.
Para ver la estructura del proyecto dbt resultante y el papel de cada componente, consulta Construir productos de datos con dbt.
Coding agents compatibles
- Claude Code
- OpenAI Codex
- GitHub Copilot CLI
- Cursor, Aider y cualquier otro agente que lea
AGENTS.md(o que use directamente la carpetaskills/)
Los comandos de instalación exactos para tu producto de datos, con la URL de tu repositorio ya rellenada, se muestran en la pestaña Builder.
Configuración
Dos pasos únicos por repositorio: instalar el plugin y conectar la CLI.
claude plugin marketplace add https://github.com/entropy-data/dataproduct-builder-dbt
claude plugin install dataproduct-builder-dbt@dataproduct-builder-dbt -s project
uv tool install --upgrade entropy-data
entropy-data connection add default --api-key <your-api-key> --host <your-entropy-data-host>
Genera la API key en Organization Settings → API Keys. Para CI, usa una clave con alcance de equipo o de organización guardada como secreto del repositorio. La pestaña Builder te da los dos comandos con el host y la clave ya rellenados.
Entropy Data
Entropy Data es un marketplace de productos de datos gobernados por Data Contracts. El Data Product Builder cierra el círculo entre contrato e implementación: edita el contrato en el marketplace, pásale el prompt a tu agente y el producto de datos sale con los Output Ports, los tests, el data lineage y los metadatos ya cableados.
El producto de datos que construye el agente es mucho más que código en un repositorio. Aparece completamente integrado en Entropy Data:
- Ficha en el marketplace: Shelf Warmers se puede descubrir con su propósito, su equipo propietario, sus Output Ports y sus condiciones de uso, tanto por personas como por agentes de IA.
- Data lineage: desde Articles latest y Stock Update Events, pasando por los modelos dbt, hasta el Output Port, publicado vía OpenLineage en cada ejecución.
- Resultados de los tests de contrato: cada ejecución de
datacontract testreporta sus resultados, así los Data Consumers ven de un vistazo que el producto entrega lo prometido. - Detección de drift: Entropy Data avisa cuando la implementación real se desvía del contrato.
- Gestión de accesos: los Data Consumers solicitan acceso al Output Port y las aprobaciones pueden aprovisionar los roles en la plataforma de datos.
- Datos de ejemplo: filas de muestra sin PII para que los Data Consumers evalúen el producto antes de pedir acceso.
Empieza gratis, explora la demo o lee la documentación del Data Product Builder.