双路径接入
已有八爪鱼任务可启动后清洗;已有 JSON、CSV、Excel 文件可直接清洗。
招投标数据工作流
MCP 文档 ↗
核心亮点
tender-cleaner 连接的是两类既有资产:八爪鱼采集任务与本地招投标文件; 以一致的处理规则,交付结构统一、来源可查的数据结果。
已有八爪鱼任务可启动后清洗;已有 JSON、CSV、Excel 文件可直接清洗。
先完成全部任务的唯一解析;任务名缺失或重名时不启动,避免误操作。
以导出文件为准,不将预览 sampleData 误当作完整结果。
统一输出 Excel 可直接打开的 CSV 与可复核 JSON,保留真实来源链接。
场景痛点
招投标信息通常不是缺少,而是结构不一致、处理成本高,导致团队难以快速判断和复用。
| 常见问题 | 业务表现 | Skill 的处理方式 |
|---|---|---|
| 数据来源分散 | 不同网站、不同任务、不同文件格式混在一起,难以统一管理。 | 双路径接入,汇入同一清洗内核。 |
| 公告结构杂乱 | 项目名称、金额、时间、联系人散落在标题、正文或不同列中。 | 抽取并映射到固定 29 字段。 |
| 人工处理高频易错 | 复制、筛选、合并、去重和核验需要反复人工操作。 | 通过规则化处理与异常隔离降低重复劳动。 |
| 结果难以复用 | 原始公告不能直接支持项目横向比较、业务筛选或后续跟进。 | 交付可分析、可回溯的数据表,再进入推荐对话。 |
处理过程 · 两条入口
没有采集任务也可以直接清洗;已有任务则可由 Agent 编排完成“启动—等待—导出—清洗”。
输入:一个或多个任务名 / taskId
输入:JSON / CSV / TSV / XLSX / XLSM / XLS
处理过程 · 清洗效果
以下为“慧招标”与“云南省中医医院招标”的既有演示快照:2026-07-16 18:50(Asia/Shanghai)。该快照用于说明清洗效果,不代表当前可投项目。
{
"title": "【招标公告】…",
"url": "https://…",
"content": "项目概况…资格要求…
…",
"published_at": "2026-…"
}
跨站点字段不统一,正文堆叠,关键信息散落在不同位置。
94 条原始公告,经清洗后形成 94 条、29 字段的统一数据表。
完整流程图
每一步都有明确输入、处理动作和可检查的结果;发生异常时保留已成功的任务结果,而不是让整批数据失效。
已有采集任务,或已有本地文件。
按任务名 / taskId 校验,避免误启动。
启动云任务并轮询至终态;本地文件直接进入清洗。
下载完整 JSON,不用预览样本代替结果。
抽取并标准化为固定 29 字段。
多来源按链接优先去重,异常单独隔离。
生成 Excel 可打开的 CSV 与可复核 JSON。
基于清洗数据再做项目筛选与投递准备。
先完成全部任务的唯一解析;名称缺失或重名时停止启动,避免错误操作。
以导出文件为准,不把接口返回的 sampleData 误当作完整结果。
CSV 与 JSON 行数一致,来源链接保留,缺失值留空而不编造。
交付标准 · 统一字段契约
字段并非越多越好。这里保留招投标使用中最常见、最需要复核的项目、节点、联系与结果信息。
| 字段组 | 覆盖内容 | 使用价值 |
|---|---|---|
| 项目识别 | 原标题、来源链接、项目名称、招标编号、项目执行地址、项目规模 | 定位项目、核验来源、识别区域与编号 |
| 采购与节点 | 招标范围、项目工期、招标金额、获取招标文件时间、投标截止时间、开标时间 | 判断范围、金额与报名 / 投标时间 |
| 开评标信息 | 开标方式、开标地点 | 安排参与方式与现场准备 |
| 招标人信息 | 招标人、招标联系人、招标人电话、招标单位、招标人邮箱、招标人地址 | 支持联系与客户主体识别 |
| 代理与结果 | 招标代理机构名称、代理机构地址、代理机构联系人、代理机构电话、代理机构邮箱、中标人、中标候选人、中标金额、中标公告时间 | 识别代理关系并保留结果公告线索 |
仅识别预算、最高限价或控制价,统一为“元”;文件费、保证金、代理费不计入招标金额。
来源链接只保留原始数据中的真实地址,不生成、不改写,便于回到公告核验。
多输入优先按来源链接去重;无链接时才按标题、发布时间和正文前缀组合判断。
适用人群
面向既需要效率,也需要保留数据依据的业务、运营、数据和自动化团队。
集中查看项目、招标节点与联系人,减少反复翻网页。
把可复核的项目池作为客户跟进和方案匹配的起点。
复用采集任务与字段契约,稳定输出标准化数据。
把既有任务接入 Agent 工作流,减少重复人工操作。
用户价值
通过可控的任务处理、可复核的数据交付与可延展的后续对话,让数据处理不止停留在“导出完成”。
| 典型问题 | 流程中的处理方式 | 得到的改变 |
|---|---|---|
| 跨网站字段和正文格式不同 | 字段映射与正文规则提取 | 一张可横向比较的数据表 |
| 任务很多,容易启动错对象 | 本地精确匹配、重名即停止 | 操作更可控,减少误触发 |
| 预览数据看似足够,实际不完整 | 下载导出的完整文件 | 结果可统计、可复核 |
| 不同来源数据混在一起 | 链接优先的合并去重与异常隔离 | 保留来源,降低重复处理 |
| 清洗后还要判断哪些项目值得跟 | 将清洗数据带入后续推荐对话 | 在企业需求约束下继续筛选 |
清洗之后,才进入业务判断
清洗结果让推荐有可靠的输入。后续只需在新对话中补充企业所在区域、行业资质、预算、交付能力与排除条件,即可让 Agent 基于统一字段做筛选、分级和投递材料准备。
示例漏斗,随企业需求变化;不写入清洗 Skill。
从一个真实任务开始
先阅读 MCP 接入说明,再准备任务名 / taskId 或一份本地数据文件。API Key 仅在需要启动云任务时由用户自行提供,Skill 不保存密钥。