Documents skills

Browse reusable Agent Skills, each with a clear purpose and practical guidance.

docx_pack

将解压的XML目录重新打包为DOCX文件

541 repo starsObserved in 1 repos
Documents

docx_unpack

将DOCX文件解压为XML目录

541 repo starsObserved in 1 repos
Documents

duplicate_detector_exact

精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录,速度快、无额外依赖。 当用户提到精确去重、完全重复检测、数据去重等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

duplicate_detector_fuzzy

模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。 当用户提到模糊去重、近似重复检测、相似度去重、文本去重等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

duplicate_fragment_cleaner

文本内部重复片段模糊清理工具。读取 JSONL 文本数据,按文本字段删除近似重复的段落、句子或连续片段,保留首次出现内容并输出清理后的样本。 当用户提到清理重复片段、删除重复段落、去掉近似重复内容等需求时使用此 skill。 即使用户没有明确说出 "duplicate_fragment_cleaner",只要任务涉及同一文本内部的重复片段清理,就应该使用此 skill。 不负责跨记录去重、摘要改写或语义重写。

541 repo starsObserved in 1 repos
Documents

duplicate_row_check

结构化表格重复行检测工具。仅检查CSV/TSV/Excel等表格型数据中的完全重复记录或指定列子集重复, 标记后续重复行并保留首次出现;不处理文本片段清理、文档去重或其他字段质控。

541 repo starsObserved in 1 repos
Documents

empty_formatter

空数据格式化器。用于创建空数据。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到创建空数据集、生成空数据、初始化数据集、测试用空数据等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents