Dataiku DSS Concept-10-Pre-filter, Post-filter, & Computed columns视觉化receipes中的通用步骤:预过滤、后过滤与计算列

Dataiku DSS Common steps in visual recipes: Pre-filter, Post-filter, & Computed columns视觉化receipes中的通用步骤:预过滤、后过滤与计算列
在使用Dataiku 视觉化receipes时,你可以利用一些在多个receipes中通用的步骤。这些通用步骤包括:
Ø预过滤(Pre-Filter)
Ø后过滤(Post-Filter)
Ø计算列(Computed Columns)
在处理数据项目时,过滤通常与其他数据准备步骤结合使用。例如,我们可以在应用其他视觉化receipes之前,先用一个“采样/过滤 (Sample/Filter)”receipes从大数据集中选择一个较小的子集。
在另一些情况下,我们可能在应用了一个计算全量数据集聚合统计信息的视觉化receipes之后,才使用“采样/过滤”receipes,以便只保留我们感兴趣的特定子集。
为了简化这一过程,Dataiku 允许用户在大多数视觉化receipes中直接应用预过滤或后过滤。这意味着,你不再需要在那一个receipes前后专门添加一个独立的“采样/过滤”receipes,而只需进入receipes本身的预过滤或后过滤步骤即可。
同样,计算列步骤允许在视觉化receipes中直接计算新列,而无需专门创建一个带有公式处理器的“准备 (Prepare)”receipes。
让我们看看这些通用步骤是如何工作的。
1. 预过滤 (Pre-filter)
预过滤步骤适用于大多数视觉化receipes,包括:
Ø分组(Group)、去重(Distinct)、排序(Sort)
Ø关联(Join)、拆分(Split)、堆叠(Stack)
Ø窗口(Window)、透视(Pivot)、前N 项 (TopN)
要应用预过滤,只需进入上述任一receipes的 Pre-Filter 步骤并激活 Filter 即可。例如,如果你正在处理信用卡交易数据集,可以在应用其他逻辑之前,使用预过滤仅保留对应于特定省份的行。

2. 后过滤 (Post-filter)
视觉化receipes中的后过滤步骤与预过滤类似。你可以在以下receipes中应用后过滤:
Ø分组(Group)、关联(Join)、去重(Distinct)
Ø窗口(Window)、堆叠(Stack)
应用场景示例: 假设我们还在处理同一个信用卡交易数据集。我们希望使用“分组 (Group)”receipes,且只保留平均购买金额超过100 的交易记录。
在这种情况下,我们需要使用后过滤,因为我们要根据分组receipes计算出的新值(平均金额)来过滤新生成的行。
此外,你还可以在后过滤步骤中使用Distinct 功能来删除重复行。与过滤功能类似,这可以让你避免创建一个单独的“去重 (Distinct)”receipes。

3. 计算列 (Computed columns)
我们经常需要根据现有列创建新列。通常这可以通过“准备 (Prepare)”receipes中的“公式 (Formula)”处理器来实现。
然而,如果只是为了添加一个公式步骤并计算一个新列,并不总是需要创建一个全新的“prepare”receipes。相反,你可以通过以下receipes中的 Computed Columns 步骤来节省时间:
Ø分组(Group)、排序(Sort)、关联(Join)
Ø拆分(Split)、窗口(Window)、透视(Pivot)、前N 项 (TopN)
计算列步骤允许你根据输入数据集的现有列,使用Dataiku 公式或 SQL 创建新列。

例如,你可以使用公式创建一个新列card_purchase_amount_range(卡片购买金额范围),或使用SQL 表达式创建一个 count_of_records(记录计数)列。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)