Documents skills

Browse reusable Agent Skills, each with a clear purpose and practical guidance.

text_action_filter

文本动作词过滤器。过滤以保留文本中包含操作的文本。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到动作词过滤、动词检测、文本动作过滤、文本操作词过滤等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

text_collector

纯文本文件采集工具。读取单个文本文件或目录中的 txt、md、rst、log、text 文件,执行文件正文采集,输出结构化文本记录文件。 当用户提到文本文件采集、读取纯文本语料、汇总 Markdown/RST/日志文本、把本地文本文件转成结构化记录等需求时使用此 skill。 即使用户没有明确说出"文本采集",只要任务涉及把本地纯文本文件内容收集成统一记录,就应该使用此 skill。 不负责文档解析、图片解析、表格读取、文本清洗或质量过滤。

541 repo starsObserved in 1 repos
Documents

text_entity_dependency_filter

文本实体依赖过滤器。识别文本中与其他令牌独立的实体,并对其进行过滤。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到实体依赖过滤、文本实体检测、依存关系过滤、实体独立性过滤等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

text_fragment_remover

指定文本片段删除工具。读取结构化数据中的文本字段,删除用户显式给出的固定片段并保留其他字段不变。 当用户提到删除固定词、固定占位符、固定水印短语、固定噪声片段等需求时使用此skill。 即使用户没有明确说出 skill 名,只要任务是按明确片段从文本字段中移除内容,就应该使用此skill。 不负责按类别自动识别 HTML、URL、emoji、数字、标点、控制字符等内容,这些应交给专用清洗 skill。

541 repo starsObserved in 1 repos
Documents

text_pair_similarity_filter

文本对相似度过滤器。过滤器将文本之间具有相似性的文本对保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到文本对相似度过滤、文本对过滤、双文本相似度、文本配对过滤等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents

text_splitter

长文本规则切分工具。将超长文本按照段落、句子、固定字符长度、非空行或科研论文章节标题进行自动切分,生成粒度均匀的短文本片段。 当用户提到文本切分、长文本拆分、按段落分割、按句子分割、文本分块、论文章节切分等需求时使用此skill。 适用于科研论文、实验综述、长篇文稿等资料的粒度拆分需求。 不负责采样、清洗、格式转换或PDF解析。

541 repo starsObserved in 1 repos
Documents

time_anomaly_marker

时序/数值异常标记工具。对指定或全部数值列进行 Z-Score 异常和差分突变检测, 输出 anomaly_flag 与 anomaly_reasons,不删除数据,适用于时序稳态/突变异常识别。

541 repo starsObserved in 1 repos
Documents

time_currency_normalizer

时间/货币归一工具。读取结构化文本数据,将常见日期格式统一为YYYY-MM-DD,将$、€、¥/¥前缀金额转换为USD/EUR/CNY数值表达。 当用户提到统一日期格式、标准化货币金额、清洗时间表述等需求时使用此skill。 即使用户没有明确说出skill名,只要任务涉及日期或货币符号的归一化,就应该使用此skill。 不负责汇率换算、时区转换或非前缀货币单位解析。

541 repo starsObserved in 1 repos
Documents

time_window_sampler

时间窗口采样算子。读取JSONL时间序列记录,按指定时间窗口分组后在每个窗口内均匀抽取样本。 当用户提到按天抽样、按小时抽样、周期性抽样、时间窗口采样等需求时使用此skill。 即使用户没有明确说出"时间窗口采样",只要任务涉及按时间粒度分组后抽样,就应该使用此skill。 不负责时间字段清洗、时间聚合统计或异常检测。

541 repo starsObserved in 1 repos
Documents

token_num_filter

Token数量过滤器。筛选器将总令牌数的样本保留在特定范围内。 本SKILL使用依赖data_juicer,请在调用前安装好python环境并安装data_juicer,你可用以下指令进行安装: pip install py-data-juicer 当用户提到token数量过滤、文本token数筛选、按token数过滤、文本分词过滤等需求时使用此skill。

541 repo starsObserved in 1 repos
Documents