# Data Engineer RD-017

**Company:** [Irth Solutions](http://jobs.workable.com/companies/sqR447VigYtCXwWEvHzdPL.md)
**Location:** Remote
**Workplace:** remote
**Employment type:** Full-time

[Apply for this job](http://jobs.workable.com/view/ba9c2b77-4297-4d67-942c-08fe85d3c207)

## Description

**Data Engineer (Mid-level)**

**Location:** Remote (Quebec/Canada) 

**About Irth Solutions**

Irth Solutions is a leading provider of cloud-based SaaS software for damage prevention, asset integrity, stakeholder engagement and land management, helping energy, utility, telecom, and infrastructure companies protect their critical network infrastructure. With nearly three decades of industry experience, Irth serves customers across North America and continues to expand its platform with new data-driven and AI-powered capabilities.

**About the Role**

We are looking for a Data Engineer to design, build, and maintain data ingestion and processing pipelines in Databricks, transforming high-volume external data sources into clean, structured, reliable inputs for downstream analysis and intelligence. This role will primarily support our Stakeholder Engagement offering, working closely with our Data Scientist and application teams.

**Key responsibilities**

**1\. Data Pipeline Development (Primary Responsibility)**

-   Design, build, and maintain ingestion pipelines from high-volume external APIs, capable of running continuously and reliably at scale.
-   Implement ingestion and transformation workflows using Databricks (Spark/PySpark, SQL, Delta Live Tables), applying medallion architecture patterns (Bronze → Silver → Gold) to move from raw ingested content to clean, structured, analysis-ready data.
-   Build the infrastructure for deduplication and relevance filtering of incoming content, implementing filtering logic and quality criteria defined in collaboration with the Data Scientist.
-   Implement schema evolution handling and data validation rules as data sources and formats change over time.

**2\. Platform & Storage Implementation**

-   Configure and manage Delta Lake storage structures, tables, partitions, and optimization routines (OPTIMIZE, Z-ORDER, VACUUM).
-   Design and evolve data schemas that balance query performance, cost, and maintainability as data volume grows.
-   Maintain clear metadata and documentation of table structures to support easy consumption by the Data Science and application teams.

**3\. Reliability, Monitoring & Operational Support**

-   Ensure pipeline reliability and observability: error handling, retries, monitoring, and alerting for a continuously running system.
-   Adapt pipelines to evolving external API contracts, rate limits, authentication changes, and new data sources.
-   Troubleshoot pipeline failures, perform recovery, and tune performance as needed.

**4\. Orchestration & Automation**

-   Build, schedule, and monitor workflows using Databricks Workflows, Delta Live Tables, or similar orchestration tools.
-   Contribute to CI/CD pipelines for code deployment, versioning, and environment management.

**5\. Collaboration & Documentation**

-   Work closely with the Data Scientist to expose clean, well-structured data feeding LLM/NLP pipelines and downstream models.
-   Participate in technical decisions around data architecture and propose structuring solutions as the team's needs evolve.
-   Document pipelines, data dictionaries, job schedules, and transformation logic.
-   Support the onboarding of new data sources and pipelines as the product expands to additional solution areas.

**Ingénieur(e) de données (Intermédiaire)**

**Lieu :** Télétravail (Québec/Canada)

**À propos d'Irth Solutions**

Irth Solutions est un fournisseur de premier plan de logiciels SaaS infonuagiques pour la prévention des dommages, l'intégrité des actifs, la mobilisation des parties prenantes et la gestion foncière, aidant les entreprises des secteurs de l'énergie, des services publics, des télécommunications et des infrastructures à protéger leurs réseaux d'infrastructure critiques. Avec près de trois décennies d'expérience dans l'industrie, Irth dessert des clients à travers l'Amérique du Nord et continue d'élargir sa plateforme avec de nouvelles capacités axées sur les données et l'intelligence artificielle.

**À propos du poste**

Nous sommes à la recherche d'un(e) ingénieur(e) de données pour concevoir, construire et maintenir des pipelines d'ingestion et de traitement de données dans Databricks, transformant des sources de données externes à haut volume en données propres, structurées et fiables pour l'analyse et l'intelligence en aval. Ce poste appuiera principalement notre offre de mobilisation des parties prenantes (Stakeholder Engagement), en collaboration étroite avec notre data scientist et les équipes de développement applicatif.

**Responsabilités principales**

**1\. Développement de pipelines de données (responsabilité principale)**

-   Concevoir, construire et maintenir des pipelines d'ingestion à partir d'API externes à haut volume, capables de fonctionner de façon continue et fiable à grande échelle.
-   Implémenter des flux d'ingestion et de transformation avec Databricks (Spark/PySpark, SQL, Delta Live Tables), en appliquant les patrons d'architecture medallion (Bronze → Silver → Gold) pour transformer le contenu brut ingéré en données propres, structurées et prêtes pour l'analyse.
-   Construire l'infrastructure de déduplication et de filtrage de pertinence du contenu entrant, en implémentant la logique de filtrage et les critères de qualité définis en collaboration avec le data scientist.
-   Implémenter la gestion de l'évolution des schémas et des règles de validation des données, à mesure que les sources et formats de données évoluent.

**2\. Implémentation de la plateforme et du stockage**

-   Configurer et gérer les structures de stockage Delta Lake, les tables, le partitionnement et les routines d'optimisation (OPTIMIZE, Z-ORDER, VACUUM).
-   Concevoir et faire évoluer des schémas de données qui équilibrent performance des requêtes, coûts et facilité de maintenance à mesure que le volume de données croît.
-   Maintenir une documentation claire des métadonnées et des structures de tables afin de faciliter leur utilisation par les équipes de data science et de développement applicatif.

**3\. Fiabilité, surveillance et soutien opérationnel**

-   Assurer la fiabilité et l'observabilité des pipelines : gestion des erreurs, mécanismes de reprise (retries), surveillance et alertes pour un système fonctionnant en continu.
-   Adapter les pipelines aux changements des contrats d'API externes, des limites de taux (rate limits), des méthodes d'authentification et à l'ajout de nouvelles sources de données.
-   Diagnostiquer les défaillances des pipelines, effectuer les reprises nécessaires et optimiser la performance au besoin.

**4\. Orchestration et automatisation**

-   Construire, planifier et surveiller des flux de travail avec Databricks Workflows, Delta Live Tables ou des outils d'orchestration équivalents.
-   Contribuer aux pipelines CI/CD pour le déploiement du code, la gestion des versions et des environnements.

**5\. Collaboration et documentation**

-   Collaborer étroitement avec le data scientist pour fournir des données propres et bien structurées alimentant les pipelines LLM/NLP et les modèles en aval.
-   Participer aux décisions techniques liées à l'architecture des données et proposer des solutions structurantes à mesure que les besoins de l'équipe évoluent.
-   Documenter les pipelines, les dictionnaires de données, les calendriers d'exécution et la logique de transformation.
-   Appuyer l'intégration de nouvelles sources et pipelines de données à mesure que le produit s'étend à d'autres domaines de solutions.

**Exigences**

Forte préférence pour les candidat(e)s résidant au Québec, la maîtrise du français (parlé et écrit) constituant un atout important en plus de l'anglais.

## Requirements

**Strong preference for candidates residing in Quebec, with fluency in French (spoken and written) as a strong asset in addition to English**

**Required qualifications**

-   3 to 5 years of experience in data engineering, with solid experience building and operating production-grade data pipelines.
-   Familiarity with data modeling, data quality, and schema evolution.
-   Solid understanding of data pipeline reliability practices: monitoring, alerting, and handling failures gracefully in a continuously running system.
-   Hands-on experience with Databricks (or an equivalent Spark-based environment): schema design, Delta Lake, performance tuning, and pipeline orchestration.
-   Experience with at least one major cloud (Azure preferred; AWS/GCP also beneficial).
-   Experience integrating with external APIs at scale: authentication, pagination, rate limiting, retries, error handling.
-   Strong proficiency in Python and SQL
-   Comfortable working with unstructured/semi-structured text data at scale.

**Nice to have Qualifications**

-   LLM prompting experience and/or basic understanding of AI/NLP concepts
-   Exposure to medallion architecture or lakehouse best practices.
-   Experience with orchestration frameworks (ADF, Workflows, Airflow, DBX, etc.).
-   Experience with CI/CD tools and version control (Git, GitHub Actions or equivalent).
-   Basic understanding of security practices: RBAC, encryption, credential management.
-   Databricks certification (Data Engineer Associate or equivalent).

**AI Use in Hiring**

As part of our hiring process, this role may use artificial intelligence or automated tools to assist with reviewing and screening applications. These tools support, but do not replace, human judgment in making hiring decisions.

**Compensation**

The salary range for this role is CAD $75000

This range reflects the **base salary only** and does not include any additional compensation components. Any offer of employment is dependent on several factors, including, but not limited to, the candidate’s experience, skills, qualifications, and location.

**Qualifications requises**

-   3 à 5 ans d'expérience en ingénierie de données, avec une solide expérience dans la construction et l'exploitation de pipelines de données en production.
-   Connaissance de la modélisation de données, de la qualité des données et de l'évolution des schémas.
-   Bonne compréhension des pratiques de fiabilité des pipelines de données : surveillance, alertes et gestion des défaillances dans un système fonctionnant en continu.
-   Expérience pratique avec Databricks (ou un environnement équivalent basé sur Spark) : conception de schémas, Delta Lake, optimisation de la performance et orchestration de pipelines.
-   Expérience avec au moins un fournisseur cloud majeur (Azure de préférence; AWS/GCP également un atout).
-   Expérience dans l'intégration d'API externes à grande échelle : authentification, pagination, limites de taux, mécanismes de reprise, gestion des erreurs.
-   Forte maîtrise de Python et SQL.
-   À l'aise avec le traitement de données textuelles non structurées ou semi-structurées à grande échelle.

**Atouts**

-   Expérience en prompt engineering avec des LLM et/ou connaissances de base en IA/NLP.
-   Connaissance de l'architecture medallion ou des meilleures pratiques lakehouse.
-   Expérience avec des frameworks d'orchestration (ADF, Workflows, Airflow, DBX, etc.).
-   Expérience avec des outils CI/CD et de contrôle de version (Git, GitHub Actions ou équivalent).
-   Connaissances de base des pratiques de sécurité : RBAC, chiffrement, gestion des identifiants.
-   Certification Databricks (Data Engineer Associate ou équivalent).

**Utilisation de l'IA dans le processus de recrutement**

Dans le cadre de notre processus de recrutement, ce poste peut faire appel à l'intelligence artificielle ou à des outils automatisés pour appuyer l'examen et la présélection des candidatures. Ces outils appuient le jugement humain dans la prise de décisions d'embauche, mais ne le remplacent pas.

**Rémunération**

L'échelle salariale pour ce poste se situe entre CAD $75000

Cette échelle reflète uniquement le **salaire de base** et n'inclut aucune autre composante de rémunération. Toute offre d'emploi dépend de plusieurs facteurs, incluant, sans s'y limiter, l'expérience, les compétences, les qualifications et le lieu de résidence du ou de la candidat(e).

## Benefits

**Benefits**

-   **Competitive Salary** – A competitive compensation package based on experience and qualifications.
-   **Medical, Dental, and Vision Insurance** – Comprehensive insurance coverage to support you and your family.
-   **401(k) Plan with Company Match.**
-   **Generous Paid Time Off (PTO)** – Time off to support work-life balance and personal needs.
-   **Company-Paid Holidays** – Paid holidays throughout the year.
-   **Flexible Work Options** – Work-from-home opportunities are available, depending on role and business needs.
-   **On-Call Compensation** – Additional pay for eligible on-call shifts.

**Avantages sociaux**

-   **Salaire compétitif** — Une rémunération concurrentielle basée sur l'expérience et les qualifications.
-   **Assurance médicale, dentaire et visuelle** — Une couverture d'assurance complète pour vous et votre famille.
-   **Régime de retraite avec contribution de l'employeur**.
-   **Congés payés généreux** — Du temps libre pour favoriser l'équilibre travail-vie personnelle.
-   **Jours fériés payés par l'entreprise** — Congés payés tout au long de l'année.
-   **Modalités de travail flexibles** — Possibilité de télétravail selon le poste et les besoins de l'entreprise.
-   **Compensation pour disponibilité** — Rémunération additionnelle pour les quarts de garde admissibles.
