ray_document_deduplicator
Ray分布式文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本,基于Ray分布式框架。 当用户提到文档去重、删除重复文档、样本去重、分布式去重、大规模数据去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模文档去重处理, 就应该使用此skill。
Browse reusable Agent Skills, each with a clear purpose and practical guidance.
Ray分布式文档去重工具。使用精确匹配(MD5哈希)在文档级别删除重复的样本,基于Ray分布式框架。 当用户提到文档去重、删除重复文档、样本去重、分布式去重、大规模数据去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模文档去重处理, 就应该使用此skill。
Ray分布式图像去重工具。使用图像哈希精确匹配在文档级别删除重复样本,基于Ray分布式框架。 当用户提到图像去重、删除重复图片、分布式去重、大规模图像去重等需求时使用此skill。 即使用户没有明确说出"Ray"或"分布式",只要任务涉及大规模图像去重处理, 就应该使用此skill。
add all numbers in a text file by 10 and save to a new file. Use when user mentions read a file add numbers by 10, process number file, batch calculation.
Minus all numbers in a text file by 5 and save to a new file. Use when user mentions read a file minus numbers by 15, process number file, batch calculation.
Multiply all numbers in a text file by 10 and save to a new file. Use when user mentions multiply numbers by 10, process number file, batch calculation.
显式 schema 校验工具。读取结构化数据与用户提供的 schema,检查字段存在性、字段类型、枚举、范围、长度、正则格式、日期格式、表级行数与缺失率约束,并输出校验报告。 当用户提到 schema 校验、结构校验、模式校验、字段存在性检查、字段类型检查、枚举校验、范围校验、格式校验、表头结构校验等需求时使用此 skill。 即使用户没有明确说出"schema_validator",只要任务是在检查结构化数据是否符合明确 schema 规则,就应该使用此 skill。 不负责数据清洗、去重、业务合理性判断、跨字段一致性、参照完整性、分布异常分析或数据转换。
科学公式/化学式规整 Skill:统一文本列中的数学符号、Unicode 上下标、化学反应箭头、全角 ASCII 和多余空格。 适用于实验记录、论文摘录、化学反应式和科学公式文本;不负责公式语义解析、单位换算或化学配平。
智能引号/排版字符规范化工具。将弯引号、长破折号、省略号等排版字符转为标准 ASCII 形式, 适配 Word/PDF/网页文本的后处理清洗。当用户提到智能引号、弯引号转直引号、排版字符规范化、 长破折号等需求时使用此skill。
特殊字符过滤器。过滤器将具有特殊字符比率的样品保持在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到特殊字符过滤、特殊字符比例过滤、文本特殊字符检测、清理乱码文本等需求时使用此skill。