Aller au contenu

Connectez vos données

Une source est un endroit d’où votre workspace lit des lignes. Cela peut être une feuille Google, une table dans Databricks ou Snowflake, une base de données Postgres, ou un jeu de données enregistré dans ce workspace. Une fois attachés, tous fonctionnent de la même manière — les travaux d’enrichissement, les rétrotests et les fixtures d’évaluation lisent tous à travers une source.

Source Lire à partir de Écrire les résultats Utiliser dans un rétrotest
Feuille Google oui oui après l’avoir capturée
Table Postgres oui oui après l’avoir capturée
Table Databricks oui non après l’avoir capturée
Table Snowflake oui non après l’avoir capturée
Jeu de données enregistré oui non oui

Les tables d’entrepôt sont en lecture seule : les travaux peuvent lire à partir d’elles, mais les résultats sont écrits ailleurs que vous choisissez — généralement dans une feuille. Si votre organisation ne propose pas un type de source, elle n’apparaîtra pas.

Paramètres du workspace → Intégrations → Connexions de données.

Votre connexion est à vous. Chaque membre connecte la sienne, et celle d’un coéquipier ne fonctionnera pas pour vous — si quelqu’un d’autre a déjà connecté l’entrepôt, vous constaterez qu’il est connecté, mais vous devez tout de même avoir le vôtre pour attacher une table.

Remplissez la carte et appuyez sur Connecter. Nous testons les identifiants contre le service réel avant de sauvegarder quoi que ce soit, donc “Connecté” signifie que ça a réellement fonctionné. Si cela n’a pas fonctionné, on vous informera si les identifiants ont été rejetés, si l’hôte n’a pas pu être atteint, ou si le délai d’attente a expiré.

Les identifiants sont chiffrés et ne sont jamais affichés à nouveau — même pas pour vous. Pour en changer un, reconnectez-vous.

Tester la connexion vérifie à nouveau un identifiant enregistré. Utilisez-le si des travaux ont commencé à échouer ; un identifiant qui a expiré ou a été rotatif apparaîtra comme nécessitant une reconnexion.

Déconnecter efface l’identifiant stocké et met en pause chaque travail qui le lisait. Rien n’est supprimé — vos sources gardent leur configuration et leur historique, et la reconnexion les redémarre. La carte vous indique combien de sources sont affectées avant de le faire.

Travaux → Sources → Attacher, ou depuis un cadre de lot dans le canevas.

Choisissez le type de source, puis remplissez l’étape qu’elle nécessite :

  • Feuille Google — collez le lien de la feuille, choisissez un onglet et associez les colonnes.
  • Jeu de données enregistré — choisissez-en un dans la bibliothèque de ce workspace. Rien d’autre à remplir.
  • Databricks ou Snowflake — donnez le catalogue (Databricks) ou la base de données (Snowflake), le schéma et la table, puis appuyez sur Aperçu de la table pour vérifier que vous avez la bonne avant d’associer les colonnes.

Un type de source que vous n’avez pas encore connecté apparaît grisé, avec une note vous indiquant de le connecter d’abord.

Chaque source a besoin d’une colonne qui identifie une ligne — c’est ainsi que le produit sait quelle ligne il a déjà traitée. Choisissez quelque chose qui ne change pas : un ID plutôt qu’un nom que quelqu’un pourrait modifier.

Colonne de date de modification (tables d’entrepôt)

Section titled “Colonne de date de modification (tables d’entrepôt)”

Si votre table a un timestamp “dernière mise à jour”, indiquez-le. Sans cela, chaque ligne est considérée comme nécessitant du travail à chaque exécution. Sur une grande table, c’est important.

Un jeu de données est un ensemble fixe de lignes conservé dans ce workspace. Les jeux de données sont ceux sur lesquels les rétrotests et les évaluations sont exécutés, car ils ne changent pas pendant une exécution.

Trouvez-les sous Travaux → Jeux de données. Il existe trois manières d’en créer un.

Directement dans le formulaire. Bon pour une liste courte.

Travaux → Jeux de données → Importer un fichier.

  • Indiquez-nous quelle colonne est la clé si elle n’est pas appelée key.
  • Si votre fichier enregistre quand chaque ligne est devenue vraie — une date d’annonce, la date d’un prix de fermeture — indiquer cette colonne. Cela transforme le fichier en une véritable histoire sur laquelle vous pouvez faire des rétrotests.
  • Si vous l’omettez, chaque ligne est marquée comme connue depuis le moment où vous l’avez téléchargée.

Un fichier peut contenir jusqu’à 50 000 lignes et 4 Mo. Au-delà de l’une ou l’autre limite, l’importation est refusée et vous en informe — rien n’est silencieusement coupé.

Travaux → Jeux de données → Capturer à partir d’une source.

Cela lit une source que vous avez déjà attachée et enregistre le résultat dans la bibliothèque. C’est ainsi qu’une table en direct devient quelque chose sur lequel vous pouvez faire des rétrotests.

Une chose à comprendre à propos de la capture :

Une capture est un instantané à partir de maintenant — pas une reconstruction du passé.

Chaque ligne est enregistrée comme connue au moment où vous l’avez capturée. Donc une unique capture utilisée dans un rétrotest sur une plage de dates passées ne trouvera rien du tout — à juste titre, car aucune de ces données n’était connaissable à l’époque.

Pour construire quelque chose sur lequel vous pouvez faire des rétrotests, choisissez Ajouter à un jeu de données existant plutôt que de créer un nouveau. Chaque capture ajoute uniquement les lignes dont la valeur a réellement changé, estampillées avec le moment où vous les avez capturées. Capturez la même source à nouveau la semaine prochaine et le mois prochain, et le jeu de données devient une véritable histoire : chaque date dans un rétrotest voit la valeur qui était actuelle à ce moment-là.

Il n’y a pas encore de calendrier automatique — répétez la capture quand vous voulez un autre point.

Si vos données enregistrent déjà quand chaque ligne est devenue vraie (un CSV importé avec une colonne connue-à, par exemple), la capture conserve ces dates plutôt que de les remplacer, et elle est directement rétrotestable.

La lecture se produit en arrière-plan, donc le jeu de données apparaît dans la liste un moment plus tard plutôt qu’immédiatement. Les mêmes limites de taille s’appliquent, et une source trop grande pour être stockée est refusée plutôt que partiellement enregistrée.

“Connectez cela dans les intégrations d’abord” — vous n’avez pas encore votre propre identifiant pour ce type de source. Celui d’un coéquipier ne compte pas.

“Cet identifiant a cessé de fonctionner” — l’identifiant enregistré ne fonctionne plus. Il a peut-être été rotatif ou expiré. Reconnectez-vous.

Vos travaux sont en pause — soit l’identifiant par lequel ils lisaient a été déconnecté, soit la source a été détachée. Reconnectez ou rattachez-la, puis réactivez le travail. Rien n’a été perdu.

“Identifiant invalide” — un nom de catalogue, de schéma, de table ou de colonne contient des caractères que nous ne mettrons pas dans une requête. Utilisez des noms simples, sans guillemets, points-virgules ou points à l’intérieur d’un seul champ.

“Déjà attaché” — ce workspace a déjà une source active pointant exactement vers cette feuille, table ou jeu de données.

Un travail a échoué en disant qu’il ne pouvait pas écrire — sa cible est une source en lecture seule, comme une table d’entrepôt ou un jeu de données. Dirigez le travail vers une feuille à la place.

Lire votre propre base de données ou entrepôt utilise votre capacité de calcul, facturée par ce fournisseur — nous n’ajoutons pas de frais pour cela. L’enrichissement qui appelle un modèle est facturé comme d’habitude ; voir Utilisation et facturation.