Lucas Arteaga

Buenos Aires, Argentina · open to relocate to Neuquén

Buenos Aires, Argentina · con disponibilidad de relocalización a Neuquén

Lucas Arteaga

Petroleum Engineering @ UBA · Technical Contract Analyst & Expeditor @ Valbol Worcester

Ingeniería en Petróleo @ UBA · Technical Contract Analyst & Expeditor @ Valbol Worcester

I understand the economics behind every technical decision — and I optimize operating flows with data.
Entiendo el impacto económico detrás de cada decisión técnica, y optimizo los flujos operativos con datos.

I review engineering specifications for a living. I know what a deviation costs once it reaches the shop floor — so I catch it on the data sheet, and I automate everything around that check.

Reviso especificaciones de ingeniería para vivir. Sé cuánto cuesta una desviación cuando ya llegó al taller — por eso la detecto en el data sheet, y automatizo todo lo que rodea ese control.

0certified hourshoras certificadas
0well-month records processedregistros pozo-mes procesados
0kept after documented cleaningconservados tras limpieza documentada
0models compared under 5-fold CVmodelos comparados con CV de 5 folds

What I doQué hago

Fifth-year Petroleum Engineering student at Universidad de Buenos Aires, working full time at an API valve manufacturer that supplies upstream operators.

Estudiante de quinto año de Ingeniería en Petróleo (UBA), trabajando a tiempo completo en un fabricante de válvulas API que provee a operadoras de Upstream.

Technical compliance

Cumplimiento técnico

Review and validate engineering documentation for ball, control, butterfly and retention valves against API 6D, API 6A, ASME B16.34, ASME B16.5 and ASTM — catching data sheet deviations before manufacturing starts.

Reviso y valido documentación de ingeniería de válvulas esféricas, de control, mariposa y retención bajo API 6D, API 6A, ASME B16.34, ASME B16.5 y ASTM — detectando desvíos antes de que arranque la fabricación.

Expediting & delivery risk

Expediting y riesgo de entrega

Coordinate critical deliveries with the shop floor, anticipate blockers, and report status to operators with numbers instead of optimism.

Coordino entregas críticas con planta, anticipo bloqueos y reporto estado a las operadoras con números, no con optimismo.

Well & production data

Datos de pozo y producción

Certified in OpenWells, Data Analyzer and PROFILE (Halliburton Landmark). Production analytics, GOR/RGP modelling, well KPIs, reservoir characterization.

Certificado en OpenWells, Data Analyzer y PROFILE (Halliburton Landmark). Analítica de producción, modelado de RGP/GOR, KPIs de pozo, caracterización de reservorios.

Automation & AI

Automatización e IA

Python and SQL pipelines, scikit-learn models, n8n workflows, API integrations, Docker. Certified in AI Automation, advanced level.

Pipelines en Python y SQL, modelos con scikit-learn, flujos en n8n, integración de APIs, Docker. Certificado en AI Automation, nivel avanzado.

Selected workTrabajo seleccionado

Special mention Mención especial Fundación Sadosky & Fundación YPF · 2025 Fundación Sadosky & Fundación YPF · 2025

Comparison of regression models for GOR prediction

Comparación de modelos de regresión para la predicción de RGP

Processed 174,815 well-month records and kept 125,018 after applying a documented cleaning policy — 48,533 rows were non-physical, with zero or negative production. The target was heavily skewed, so it was log-transformed before modelling. Five models were compared under 5-fold cross-validation: a linear baseline, decision trees at two depths, and random forests at two sizes.

Procesé 174.815 registros pozo-mes y conservé 125.018 aplicando una política de limpieza documentada — 48.533 filas eran no físicas, con producción cero o negativa. El target tenía fuerte asimetría, así que se transformó a logaritmo antes de modelar. Se compararon cinco modelos con validación cruzada de 5 folds: una base lineal, árboles de decisión en dos profundidades y random forests en dos tamaños.

The decision that mattered was not the leaderboard. The 100-tree forest reached R² 0.57; the 50-tree forest reached 0.56 and trained in half the time — 266 s against 519 s. In an operating environment, that is what decides which model actually gets deployed.

La decisión que importó no fue el ranking. El bosque de 100 árboles alcanzó R² 0,57; el de 50 alcanzó 0,56 y entrenó en la mitad del tiempo — 266 s contra 519 s. En un entorno operativo, eso decide qué modelo se pone en producción.

Scale
Escala
174,815 → 125,018
Target
Objetivo
GOR / RGP · log
Validation
Validación
5-fold CV
Best R²
Mejor R²
0.57
Deployed
Elegido
0.56 · 50 trees

Why there is no repository link: the dataset included operator production and drilling records, and it is not mine to publish. Not publishing another company's operational data is part of the job. The public, reproducible version is rebuilt on open data below.

Por qué no hay link al repositorio: el dataset incluía registros operativos de producción y perforación, y no es mío para publicar. No publicar datos operativos de otra empresa es parte del trabajo. La versión pública y reproducible está reconstruida sobre datos abiertos, abajo.

Public · open data Público · datos abiertos CC-BY-4.0

well-production-data-mining

CRISP-DM data mining over official Argentine per-well production data: business filters, percentile-based categorisation, a 20×20 Self-Organizing Map with KMeans over the SOM weights, and cluster profiling with radar charts.

Minería de datos con CRISP-DM sobre la producción oficial por pozo de Argentina: filtros de negocio, categorización por percentiles, un Mapa Auto-organizado de 20×20 con KMeans sobre los pesos del SOM, y perfilado de clusters con gráficos de radar.

Python · pandas · MiniSom · scikit-learn · Jupyter

In progress En curso Secretaría de Energía · CC-BY-4.0

well-production-analytics

well-production-analytics

A reproducible production analytics pipeline over Argentina's official open well-production dataset: validated ingestion of multi-year files, data-quality reporting, basin and operator profiling, and GOR modelling. Public data, so anyone can run it — and nothing confidential to hide behind.

Un pipeline reproducible de analítica de producción sobre el dataset oficial abierto de producción por pozo de Argentina: ingesta validada de archivos multi-año, reporte de calidad de datos, perfilado por cuenca y operadora, y modelado de RGP. Datos públicos, así que cualquiera puede correrlo — y nada confidencial que esconder.

CertificationsCertificaciones

270 certified hours across petroleum data science, industrial operations, industrial software and technical communication.

270 horas certificadas entre ciencia de datos aplicada a petróleo, operación industrial, software industrial y comunicación técnica.

How I workCómo trabajo

  1. Validate before it gets built

    Validar antes de construir

    A deviation caught on a data sheet costs a revision. The same deviation caught on the shop floor costs a scrapped part, a delayed delivery and an angry operator. The earlier the check, the cheaper the fix — true of data and of valves.

    Una desviación detectada en el data sheet cuesta una revisión. La misma detectada en el taller cuesta una pieza rechazada, una entrega demorada y una operadora enojada. Cuanto más temprano el control, más barata la corrección — vale para datos y para válvulas.

  2. Clean the data before touching the model

    Limpiar los datos antes de tocar el modelo

    48,533 of 174,815 records were non-physical. Modelling on top of them would have produced a confident answer to a question nobody asked.

    48.533 de 174.815 registros eran no físicos. Modelar encima de eso habría dado una respuesta segura a una pregunta que nadie hizo.

  3. Report the cost of a decision, not just the number

    Reportar el costo de una decisión, no sólo el número

    0.57 versus 0.56 is noise. Doubling the training time is not. That comparison is what turns a metric into a decision.

    0,57 contra 0,56 es ruido. Duplicar el tiempo de entrenamiento no lo es. Esa comparación es la que convierte una métrica en una decisión.

  4. Say what does not work

    Decir lo que no funciona

    My dataset was a snapshot with no bottom-hole pressure and no petrophysics — so the model describes wells, it does not predict them. Knowing which of the two you have is most of the job.

    Mi dataset era una foto sin presión de fondo ni petrofísica — así que el modelo describe pozos, no los predice. Saber cuál de las dos cosas tenés es la mayor parte del trabajo.

Let's talkHablemos

Open to Petroleum Engineering, production data, well operations and technical automation roles.

Abierto a posiciones de Ingeniería en Petróleo, datos de producción, operaciones de pozo y automatización técnica.