跳转到内容

连接您的数据

一个 source 是您的 workspace 读取行的地方。它可以是 Google Sheet、Databricks 或 Snowflake 中的表、Postgres 数据库,或在此 workspace 中保存的数据集。一旦附加,它们的工作方式都是一样的——富集作业、回测和评估装置都通过 source 进行读取。

Source Read from it Write results back Use in a backtest
Google Sheet yes yes after capturing it
Postgres table yes yes after capturing it
Databricks table yes no after capturing it
Snowflake table yes no after capturing it
Saved dataset yes no yes

仓库表仅为 只读:作业可以读取它们,但结果会写入您选择的位置—通常是一个表。如果您的组织不提供某种 source 类型,它将不会出现。

Workspace settings → Integrations → Data connections.

您的连接是 您自己的。每个成员连接他们自己的,一个队友的连接对您无效——如果其他人已经连接了仓库,您将看到它已连接,但您仍然需要自己的连接才能附加表。

填写卡片并按 Connect。我们将在保存任何内容之前测试凭据与真实服务的匹配,因此 “Connected” 意味着它确实成功了。如果没有,您将被告知是凭据被拒绝、主机无法访问还是超时。

凭据是加密的,并且 不会再次显示——甚至对您也不会。要更改一个,重新连接即可。

Test connection 重新检查已保存的凭据。如果作业开始失败,请使用它;已过期或已轮换的凭据会显示需要重新连接。

Disconnect 清除存储的凭据,并 暂停 通过它读取的每个作业。没有任何东西被删除——您的 sources 保持其设置和历史记录,重新连接将重新启动它们。卡片会告诉您在执行该操作之前有多少 sources 受到影响。

Jobs → Sources → Attach,或从画布中的批次框架。

选择 source 的种类,然后填写所需的一个步骤:

  • Google Sheet — 粘贴表格链接,选择一个选项卡,并映射列。
  • Saved dataset — 从此 workspace 的库中选择一个。无需填写其他内容。
  • Databricks 或 Snowflake — 提供目录(Databricks)或数据库(Snowflake)、模式和表,然后按 Preview table 检查您是否选择了正确的表,然后映射列。

您尚未连接的 source 类型将呈灰色显示,并附有一条提示您先连接的说明。

每个 source 需要一个标识行的列——这就是产品知道它已经处理过哪个行的方式。选择一些不变化的内容:ID 而不是某个可能被编辑的名称。

如果您的表有一个“最后更新”时间戳,请命名它。如果没有,每行在每次运行时都被视为需要处理。在大表上,这很重要。

一个 dataset 是在此 workspace 中保留的一组固定行。数据集是回测和评估的依据,因为它们在运行中不会发生变化。

Jobs → Datasets 下找到它们。有三种方法可以制作一个。

直接输入到表单中。适用于短列表。

Jobs → Datasets → Import file.

  • 如果文件中没有名为 key 的列,请告诉我们哪个列是 key
  • 如果您的文件记录了 每行何时变为真——例如公告日期、收盘价格日期——请命名该列。这将使文件变成您可以回测的真实历史。
  • 如果您省略它,每行都将标记为在您上传的那一刻已知。

一个文件可以容纳最多 50,000 行4 MB。超过任一限制时,导入将被拒绝并告知您——没有任何内容会被静默截断。

Jobs → Datasets → Capture from a source.

这将读取您已附加的 source,并将结果保存到库中。它是如何将实时表变成可以回测的东西。

关于捕获,有一点需要理解:

捕获是一个快照 从现在开始——而不是对过去的重构。

每行在捕获时被记录为已知。因此,在过去日期范围内进行的回测中使用 单个 捕获将不会找到任何内容——这是正确的,因为当时没有那些数据是可以知道的。

要构建可以回测的内容,请选择 Add to an existing dataset 而不是创建新的。每次捕获仅添加值实际更改的行,并标记为您捕获它们的时间。下周和下个月再次捕获相同的 source,数据集将成为真实的历史:每个回测中的日期会看到当时的当前值。

目前没有自动计划——想要另一个点时重复捕获。

如果您的数据已经记录了 何时 每行变为真实(例如,带有已知列的 CSV 导入),捕获将保留那些日期而不是替换它们,并且可以立即进行回测。

读取在后台进行,因此数据集会在稍后出现在列表中,而不是立即出现。适用相同的大小限制,而且当 source 太大而无法存储时将被拒绝,而不是部分保存。

“Connect this in Integrations first”——您尚未为该 source 类型拥有自己的凭据。队友的凭据无效。

“This credential stopped working”——保存的凭据不再有效。它可能已被轮换或过期。重新连接。

您的作业已暂停——要么它们读取的凭据已断开,要么 source 已被断开。重新连接或重新附加,然后重新开启作业。没有任何东西丢失。

“Invalid identifier”——目录、模式、表或列名包含我们不会放入查询的字符。使用简单的名称,不要在单个字段内使用引号、分号或点。

“Already attached”——此 workspace 已经有一个活动 source 精确指向这个表、表格或数据集。

作业失败,提示无法写入——其目标是只读源,例如仓库表或数据集。请将作业指向一个表。

读取您自己的数据库或仓库使用 您自己的 计算,由该供应商收取费用——我们不会对此收取费用。调用模型的富集收费如常;请参见 Usage and billing