Special mention
Mención especial
Fundación Sadosky & Fundación YPF · 2025
Fundación Sadosky & Fundación YPF · 2025
Comparison of regression models for GOR prediction
Comparación de modelos de regresión para la predicción de RGP
Processed 174,815 well-month records and kept 125,018 after applying a documented cleaning policy — 48,533 rows were non-physical, with zero or negative production. The target was heavily skewed, so it was log-transformed before modelling. Five models were compared under 5-fold cross-validation: a linear baseline, decision trees at two depths, and random forests at two sizes.
Procesé 174.815 registros pozo-mes y conservé 125.018 aplicando una política de limpieza documentada — 48.533 filas eran no físicas, con producción cero o negativa. El target tenía fuerte asimetría, así que se transformó a logaritmo antes de modelar. Se compararon cinco modelos con validación cruzada de 5 folds: una base lineal, árboles de decisión en dos profundidades y random forests en dos tamaños.
The decision that mattered was not the leaderboard. The 100-tree forest reached R² 0.57; the 50-tree forest reached 0.56 and trained in half the time — 266 s against 519 s. In an operating environment, that is what decides which model actually gets deployed.
La decisión que importó no fue el ranking. El bosque de 100 árboles alcanzó R² 0,57; el de 50 alcanzó 0,56 y entrenó en la mitad del tiempo — 266 s contra 519 s. En un entorno operativo, eso decide qué modelo se pone en producción.
- Scale
- Escala
- 174,815 → 125,018
- Target
- Objetivo
- GOR / RGP · log
- Validation
- Validación
- 5-fold CV
- Best R²
- Mejor R²
- 0.57
- Deployed
- Elegido
- 0.56 · 50 trees
Why there is no repository link: the dataset included operator production and drilling records, and it is not mine to publish. Not publishing another company's operational data is part of the job. The public, reproducible version is rebuilt on open data below.
Por qué no hay link al repositorio: el dataset incluía registros operativos de producción y perforación, y no es mío para publicar. No publicar datos operativos de otra empresa es parte del trabajo. La versión pública y reproducible está reconstruida sobre datos abiertos, abajo.
Public · open data
Público · datos abiertos
CC-BY-4.0
CRISP-DM data mining over official Argentine per-well production data: business filters, percentile-based categorisation, a 20×20 Self-Organizing Map with KMeans over the SOM weights, and cluster profiling with radar charts.
Minería de datos con CRISP-DM sobre la producción oficial por pozo de Argentina: filtros de negocio, categorización por percentiles, un Mapa Auto-organizado de 20×20 con KMeans sobre los pesos del SOM, y perfilado de clusters con gráficos de radar.
Python · pandas · MiniSom · scikit-learn · Jupyter
In progress
En curso
Secretaría de Energía · CC-BY-4.0
well-production-analytics
well-production-analytics
A reproducible production analytics pipeline over Argentina's official open well-production dataset: validated ingestion of multi-year files, data-quality reporting, basin and operator profiling, and GOR modelling. Public data, so anyone can run it — and nothing confidential to hide behind.
Un pipeline reproducible de analítica de producción sobre el dataset oficial abierto de producción por pozo de Argentina: ingesta validada de archivos multi-año, reporte de calidad de datos, perfilado por cuenca y operadora, y modelado de RGP. Datos públicos, así que cualquiera puede correrlo — y nada confidencial que esconder.