Documents skills

Browse reusable Agent Skills, each with a clear purpose and practical guidance.

specified_field_filter

指定字段过滤器。根据指定的字段信息进行筛选。支持对JSONL格式数据指定字段进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到字段过滤、字段值筛选、元数据过滤、指定字段过滤、按字段值过滤等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

specified_numeric_field_filter

指定数值字段过滤器。根据指定的数值字段信息进行筛选。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到数值字段过滤、字段范围筛选、数值范围过滤、元数据数值过滤、按数值过滤等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

spelling_variant_normalizer

拼写变体标准化工具。统一英美拼写差异(colour→color、analyse→analyze 等),内置 153 词条 (含屈折形式 covered/covering 等),支持自定义词典扩展。当用户提到英美拼写统一、拼写变体、 British/American spelling 等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

statistical_outlier_detector

统计与机器学习异常值检测工具。读取结构化表格数据,使用 IQR、Z-score、IsolationForest 或分组标准差一致性方法识别异常值,输出带异常标记、删除异常行或裁剪异常值后的结果文件。 当用户提到异常值检测、离群值识别、IQR、Z-score、IsolationForest、按实验组/分类组检查数值一致性等需求时使用此skill。 即使用户没有明确说出“statistical_outlier_detector”,只要任务涉及结构化数值字段异常识别或分组均值标准差一致性检查,就应该使用此skill。 不负责字段固定阈值上下限校验、枚举值校验、时间序列缺失/频率校验或格式转换。

541 repo starsObserved in 1 repos
Documents

stopwords_filter

停用词过滤器。过滤以保持停止词比率大于特定最小值的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到停用词过滤、停用词比例过滤、文本质量过滤、停用词占比检测等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

stratified_sampler

结构化数据分层采样工具。读取 JSONL、JSON、CSV、TSV、XLSX、XLS 等结构化数据,按指定字段分层后无放回抽取样本,输出保留原字段结构的采样结果。 当用户提到分层采样、类别平衡采样、按标签抽样、训练集分层划分等需求时使用此skill。 即使用户没有明确说出"stratified_sampler",只要任务涉及按字段分层并进行代表性抽样,就应该使用此skill。 不负责随机采样、领域均衡采样、批量切分、时间窗口抽样或格式转换。

541 repo starsObserved in 1 repos
Documents

suffix_filter

后缀过滤器。过滤器以保留具有指定后缀的样本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到后缀过滤、文件类型过滤、按文件后缀筛选等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

systematic_sampler

系统采样算子。按照固定间隔从数据中进行系统采样,适用于时间序列数据或需要均匀分布样本的场景。 当用户提到系统采样、等距抽样、按间隔取样、均匀抽样等需求时使用此skill。 即使用户没有明确说出"系统采样",只要任务涉及从有序数据中按固定步长抽取样本,就应该使用此skill。 不负责分层采样或随机采样。

541 repo starsObserved in 1 repos
Documents

table_collector

表格文件采集工具。读取单个表格文件或目录中的 csv、tsv、xlsx、xls 文件,执行行记录采集,输出统一结构化表格记录文件。 当用户提到表格采集、读取科研数据表、汇总 CSV/TSV/Excel 表格、把本地表格文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"表格采集",只要任务涉及把本地结构化表格文件内容收集成统一记录,就应该使用此 skill。 不负责表格清洗、空行删除、字段去空格、格式校验、字段过滤或格式转换。

541 repo starsObserved in 1 repos
Documents

table_schema_structure_check

格式一致性校验工具。读取被检验表和标准化数据模式表,比对两者的表头结构(字段名、字段数量)是否一致, 校验通过后输出数据文件。当用户提到格式一致性校验、表头校验、数据结构比对、字段一致性检查等需求时使用此skill。 即使用户没有明确说出"格式一致性",只要任务涉及比对数据表结构与标准模式结构,就应该使用此skill。

541 repo starsObserved in 1 repos
Documents