✂️ TXT / Word 文本正则拆分工具

按正则表达式、小说章节标题、段落/空行或指定字数行数快速切割 TXT、Word (.doc / .docx) 文本 | 纯前端本地安全处理,支持 ZIP 批量导出

📄
点击或拖拽 TXT、Word (.doc / .docx) 文件到此处
支持 .txt, .docx, .doc, .log, .md, .csv, .json 等文件格式
编码选择:
📖 按正则标题/开篇拆分
适用于小说章节 (如: 第1章) 或标题行作为分块开头
✂️ 按正则分隔符拆分
按匹配到的符号、换行符或标记切割文本
📄 按固定行数拆分
每隔 N 行自动拆分为一个独立的文本文件
🔤 按固定字数拆分
每隔 N 个字符/汉字切分为一个独立分块
常用预设规则:
最小分块字数:

🎉 拆分完成 - 结果统计与批量导出

0
拆分文件数
0
总字数
0
平均每块字数
0 ms
处理耗时

💡 TXT 文本正则拆分使用教程与常用正则切分范例

📋 常用正则表达式切分规则参照表

应用场景 拆分模式 推荐正则表达式 说明与匹配效果示例
小说/网文按章节切分 按正则标题拆分 ^第[0-9一二三四五六七八九十百千万]+[章回节卷].* 自动识别“第一章 序幕”、“第一百零二章 决战”等行,拆分为各自独立的小说 TXT 文件。
Markdown 笔记按标题切分 按正则标题拆分 ^#{1,3}\s+.* 按 Markdown 的一、二、三级标题 (#, ##, ###) 切割文本。
应用/服务器日志按时间切分 按正则标题拆分 ^\d{4}-\d{2}-\d{2}\s+\d{2}:\d{2}:\d{2} 根据标准的日志时间戳 2026-08-12 10:00:00 切割条目。
段落 / 空行切分 按正则分隔符拆分 \n\s*\n+ 以连续空行作为分割点,将超长文章分割为独立段落,方便喂给 AI 语言模型。
自定义符号界定符 按正则分隔符拆分 ===+---+ 按文本中出现的 ===--- 分隔线切割分块。

🔍 经典正则表达式切分前后效果对比范例 ("最后有例子")

例子 1:网络小说大文件按“章节标题”批量拆分

输入原始文本 (Input Text):
第一章 序幕:重聚之地
在星海边境的黑曜石废墟中,风声撕裂着...

第二章 试炼与抉择
古老的神殿门扉缓缓开启,门内散发出幽蓝...

第三章 破晓的决战
守护者从黑暗中苏醒,庞大的身姿如山岳...
正则匹配规则与生成文件 (Output Files):
匹配模式: ^第[0-9一二三四五六七八九十]+[章回节卷].*
📦 打包导出为 ZIP (包含 3 个文本文件):
  • 001_第一章 序幕:重聚之地.txt
  • 002_第二章 试炼与抉择.txt
  • 003_第三章 破晓的决战.txt

例子 2:Markdown 格式技术文档按标题分割

输入原始文本 (Input Text):
# 系统架构设计说明
本系统由三个核心前端组件与 Node 后端构成...

## 数据库模块配置
数据库采用 PostgreSQL 高可用集群...

## 缓存与存储加速
使用 Redis 7.0 进行会话保持与缓存管理...
正则匹配规则与生成文件 (Output Files):
匹配模式: ^#{1,2}\s+.*
📦 打包导出为 ZIP:
  • 001_# 系统架构设计说明.txt
  • 002_## 数据库模块配置.txt
  • 003_## 缓存与存储加速.txt

例子 3:服务器日志按时间戳与错误标记切割

输入原始文本 (Input Text):
2026-08-12 10:00:01 [INFO] [System] Application service initialized...
2026-08-12 10:05:12 [WARN] [DBPool] Connection pool usage reached 85%...
2026-08-12 10:12:45 [ERROR] [PaymentService] Gateway timeout error...
正则匹配规则与生成文件 (Output Files):
匹配模式: ^\d{4}-\d{2}-\d{2}\s+\d{2}:\d{2}:\d{2}
📦 导出的日志数据卡片与单独文本文件:
  • 001_2026-08-12 10:00:01.txt
  • 002_2026-08-12 10:05:12.txt
  • 003_2026-08-12 10:12:45.txt

🎯 典型应用场景

📖 电子书与网络小说切割

将数十万字、数百万字的长篇 TXT 小说按“第X章”正则规则精细化拆分为独立文件,方便上传至电子书阅读器或进行章节校对。

🤖 LLM 大模型 Prompt 语料分块

大语言模型上下文长度受限时,可通过按空行或固定字数将超长文档分割成规范小块,用于 RAG 检索增强或语料库切片。

🖥️ 服务器运维与日志分析

分析上百兆的系统运行日志时,利用正则表达式按时间戳分割成独立事件日志,极大提升排查与搜索效率。

📝 Markdown 与学术数据预处理

将大块文档或笔记按 H1/H2 标题切割,一键压缩下载,便于多人分工协作与版本管理。

❓ 常见问题解答 (FAQ)

为什么上传中文小说后切出来的文件有乱码?

部分较旧的 TXT 小说文件采用了 GBK 或 GB2312 编码。如果出现乱码,只需在上传区下方的“编码选择”下拉菜单中切换为“GBK / GB2312”,系统即可准确识别中文字符。

处理几万字或几兆的 TXT 文件会有安全隐私风险吗?

完全无需担心!本工具基于 HTML5 Web APIs 与 JavaScript 运行,所有正则计算与 ZIP 打包压缩过程都在您的浏览器本地完成,文件绝不会上传到任何服务器,100% 保护商业秘密与个人隐私。

如何只切分大章节,忽略小标题?

您可以通过修饰正则表达式来控制精准度。例如使用 ^第[0-9一二三四五六七八九十]+卷.* 仅切分卷标题;或使用“最小分块字数”功能过滤掉字数少于指定阈值的小标题分块。