连接您的数据
一个 source 是您的 workspace 读取行的地方。它可以是 Google Sheet、Databricks 或 Snowflake 中的表、Postgres 数据库,或在此 workspace 中保存的数据集。一旦附加,它们的工作方式都是一样的——富集作业、回测和评估装置都通过 source 进行读取。
您可以连接什么
Section titled “您可以连接什么”| Source | Read from it | Write results back | Use in a backtest |
|---|---|---|---|
| Google Sheet | yes | yes | after capturing it |
| Postgres table | yes | yes | after capturing it |
| Databricks table | yes | no | after capturing it |
| Snowflake table | yes | no | after capturing it |
| Saved dataset | yes | no | yes |
仓库表仅为 只读:作业可以读取它们,但结果会写入您选择的位置—通常是一个表。如果您的组织不提供某种 source 类型,它将不会出现。
连接您的凭据
Section titled “连接您的凭据”Workspace settings → Integrations → Data connections.
您的连接是 您自己的。每个成员连接他们自己的,一个队友的连接对您无效——如果其他人已经连接了仓库,您将看到它已连接,但您仍然需要自己的连接才能附加表。
填写卡片并按 Connect。我们将在保存任何内容之前测试凭据与真实服务的匹配,因此 “Connected” 意味着它确实成功了。如果没有,您将被告知是凭据被拒绝、主机无法访问还是超时。
凭据是加密的,并且 不会再次显示——甚至对您也不会。要更改一个,重新连接即可。
Test connection 重新检查已保存的凭据。如果作业开始失败,请使用它;已过期或已轮换的凭据会显示需要重新连接。
Disconnect 清除存储的凭据,并 暂停 通过它读取的每个作业。没有任何东西被删除——您的 sources 保持其设置和历史记录,重新连接将重新启动它们。卡片会告诉您在执行该操作之前有多少 sources 受到影响。
Jobs → Sources → Attach,或从画布中的批次框架。
选择 source 的种类,然后填写所需的一个步骤:
- Google Sheet — 粘贴表格链接,选择一个选项卡,并映射列。
- Saved dataset — 从此 workspace 的库中选择一个。无需填写其他内容。
- Databricks 或 Snowflake — 提供目录(Databricks)或数据库(Snowflake)、模式和表,然后按 Preview table 检查您是否选择了正确的表,然后映射列。
您尚未连接的 source 类型将呈灰色显示,并附有一条提示您先连接的说明。
选择一个关键列
Section titled “选择一个关键列”每个 source 需要一个标识行的列——这就是产品知道它已经处理过哪个行的方式。选择一些不变化的内容:ID 而不是某个可能被编辑的名称。
Changed-at 列(仓库表)
Section titled “Changed-at 列(仓库表)”如果您的表有一个“最后更新”时间戳,请命名它。如果没有,每行在每次运行时都被视为需要处理。在大表上,这很重要。
已保存的数据集
Section titled “已保存的数据集”一个 dataset 是在此 workspace 中保留的一组固定行。数据集是回测和评估的依据,因为它们在运行中不会发生变化。
在 Jobs → Datasets 下找到它们。有三种方法可以制作一个。
直接输入到表单中。适用于短列表。
导入 CSV 或 JSON 文件
Section titled “导入 CSV 或 JSON 文件”Jobs → Datasets → Import file.
- 如果文件中没有名为
key的列,请告诉我们哪个列是 key。 - 如果您的文件记录了 每行何时变为真——例如公告日期、收盘价格日期——请命名该列。这将使文件变成您可以回测的真实历史。
- 如果您省略它,每行都将标记为在您上传的那一刻已知。
一个文件可以容纳最多 50,000 行 和 4 MB。超过任一限制时,导入将被拒绝并告知您——没有任何内容会被静默截断。
Jobs → Datasets → Capture from a source.
这将读取您已附加的 source,并将结果保存到库中。它是如何将实时表变成可以回测的东西。
关于捕获,有一点需要理解:
捕获是一个快照 从现在开始——而不是对过去的重构。
每行在捕获时被记录为已知。因此,在过去日期范围内进行的回测中使用 单个 捕获将不会找到任何内容——这是正确的,因为当时没有那些数据是可以知道的。
要构建可以回测的内容,请选择 Add to an existing dataset 而不是创建新的。每次捕获仅添加值实际更改的行,并标记为您捕获它们的时间。下周和下个月再次捕获相同的 source,数据集将成为真实的历史:每个回测中的日期会看到当时的当前值。
目前没有自动计划——想要另一个点时重复捕获。
如果您的数据已经记录了 何时 每行变为真实(例如,带有已知列的 CSV 导入),捕获将保留那些日期而不是替换它们,并且可以立即进行回测。
读取在后台进行,因此数据集会在稍后出现在列表中,而不是立即出现。适用相同的大小限制,而且当 source 太大而无法存储时将被拒绝,而不是部分保存。
如果某些功能无法正常工作
Section titled “如果某些功能无法正常工作”“Connect this in Integrations first”——您尚未为该 source 类型拥有自己的凭据。队友的凭据无效。
“This credential stopped working”——保存的凭据不再有效。它可能已被轮换或过期。重新连接。
您的作业已暂停——要么它们读取的凭据已断开,要么 source 已被断开。重新连接或重新附加,然后重新开启作业。没有任何东西丢失。
“Invalid identifier”——目录、模式、表或列名包含我们不会放入查询的字符。使用简单的名称,不要在单个字段内使用引号、分号或点。
“Already attached”——此 workspace 已经有一个活动 source 精确指向这个表、表格或数据集。
作业失败,提示无法写入——其目标是只读源,例如仓库表或数据集。请将作业指向一个表。
这需要多少费用
Section titled “这需要多少费用”读取您自己的数据库或仓库使用 您自己的 计算,由该供应商收取费用——我们不会对此收取费用。调用模型的富集收费如常;请参见 Usage and billing。