Dataiku DSS Common steps in visual recipes: Pre-filter, Post-filter, & Computed columns视觉化receipes中的通用步骤:预过滤、后过滤与计算列

在使用Dataiku 视觉化receipes时,你可以利用一些在多个receipes中通用的步骤。这些通用步骤包括:

Ø预过滤(Pre-Filter)

Ø后过滤(Post-Filter)

Ø计算列(Computed Columns)

在处理数据项目时,过滤通常与其他数据准备步骤结合使用。例如,我们可以在应用其他视觉化receipes之前,先用一个“采样/过滤 (Sample/Filter)”receipes从大数据集中选择一个较小的子集。

在另一些情况下,我们可能在应用了一个计算全量数据集聚合统计信息的视觉化receipes之后,才使用“采样/过滤”receipes,以便只保留我们感兴趣的特定子集。

为了简化这一过程,Dataiku 允许用户在大多数视觉化receipes中直接应用预过滤后过滤。这意味着,你不再需要在那一个receipes前后专门添加一个独立的“采样/过滤”receipes,而只需进入receipes本身的预过滤或后过滤步骤即可。

同样,计算列步骤允许在视觉化receipes中直接计算新列,而无需专门创建一个带有公式处理器的“准备 (Prepare)”receipes

让我们看看这些通用步骤是如何工作的。


 

1. 预过滤 (Pre-filter)

预过滤步骤适用于大多数视觉化receipes,包括:

Ø分组(Group)去重(Distinct)排序(Sort)

Ø关联(Join)拆分(Split)堆叠(Stack)

Ø窗口(Window)透视(Pivot)前N 项 (TopN)

要应用预过滤,只需进入上述任一receipes的 Pre-Filter 步骤并激活 Filter 即可。例如,如果你正在处理信用卡交易数据集,可以在应用其他逻辑之前,使用预过滤仅保留对应于特定省份的行。

 

 

2. 后过滤 (Post-filter)

视觉化receipes中的后过滤步骤与预过滤类似。你可以在以下receipes中应用后过滤:

Ø分组(Group)关联(Join)去重(Distinct)

Ø窗口(Window)堆叠(Stack)

应用场景示例: 假设我们还在处理同一个信用卡交易数据集。我们希望使用“分组 (Group)”receipes,且只保留平均购买金额超过100 的交易记录。

在这种情况下,我们需要使用后过滤,因为我们要根据分组receipes计算出的新值(平均金额)来过滤新生成的行。

此外,你还可以在后过滤步骤中使用Distinct 功能来删除重复行。与过滤功能类似,这可以让你避免创建一个单独的“去重 (Distinct)”receipes

 


 

3. 计算列 (Computed columns)

我们经常需要根据现有列创建新列。通常这可以通过“准备 (Prepare)”receipes中的“公式 (Formula)”处理器来实现。

然而,如果只是为了添加一个公式步骤并计算一个新列,并不总是需要创建一个全新的“preparereceipes。相反,你可以通过以下receipes中的 Computed Columns 步骤来节省时间:

Ø分组(Group)排序(Sort)关联(Join)

Ø拆分(Split)窗口(Window)透视(Pivot)前N 项 (TopN)

计算列步骤允许你根据输入数据集的现有列,使用Dataiku 公式或 SQL 创建新列。

 

 

例如,你可以使用公式创建一个新列card_purchase_amount_range(卡片购买金额范围),或使用SQL 表达式创建一个 count_of_records(记录计数)列。

 

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐