ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

深入 commonmark4cj 行内解析机制:加粗、删除线的分隔符匹配是如何实现的

深入 commonmark4cj 行内解析机制:加粗、删除线的分隔符匹配是如何实现的 深入 commonmark4cj 行内解析机制加粗、删除线的分隔符匹配是如何实现的【免费下载链接】commonmark4cj符合CommonMark规范的Markdown解析库项目地址: https://gitcode.com/Cangjie-TPC/commonmark4cjcommonmark4cj 是一款符合 CommonMark 规范的 Markdown 解析库它能把 Markdown 文本解析成 Node 树并渲染为 HTML。本文带你深入它的行内解析机制当你写下**加粗**或~~删除线~~时库内部靠一套「分隔符栈 双向扫描」的算法完成匹配这正是加粗、斜体、删除线得以正确渲染的核心。一图看懂匹配流程 整个匹配过程可以拆成三步步骤动作关键类/方法1️⃣ 记录扫描到*、~等符号时把它压入分隔符栈并判断能否开/闭Delimiter、DelimiterRun2️⃣ 匹配遇到闭合分隔符后向前回扫寻找可匹配的开分隔符processDelimiters3️⃣ 包装匹配成功后把中间节点包进新节点加粗/删除线DelimiterProcessor.process第一步分隔符不是马上生效而是先入栈排队普通文本在 inline_parser_impl.cj 中被扫描时遇到*、_、~这类特殊字符并不会立刻决定它是加粗还是字面字符而是先创建Delimiter分隔符对象挂到节点上并维护一条贯穿整行的分隔符链previous/next 双向指针。每个分隔符连续串Delimiter Run都携带两个关键标记定义在 delimiter_run.cjcanOpen()能否开启强调依据 CommonMark 的 flanking 规则如前接空格/标点canClose()能否闭合强调 为什么这么设计因为*斜体*里的两个*谁是谁只有看到整行内容后才能确定。先记录、后裁决是这类解析器的经典手法。第二步closer 向前回扫逐个尝试匹配真正的匹配发生在行内解析收尾阶段核心是 inline_parser_impl.cj 中的processDelimiters方法逻辑非常直白从栈顶向下找第一个canClose()的分隔符closer拿到它对应的DelimiterProcessor按字符查表*、~各有一份从 closer 向前逐个检查 opener只要opener.canOpen()且字符匹配就调用processor.process(opener, closer)尝试处理若处理返回使用数量 0匹配成功否则继续往前找。找到 opener 后已使用的分隔符字符会从两端逐个删除并解链inline_parser_impl.cj剩余的字符仍留在栈中等待下一轮匹配——这就是***bold and italic***能同时表达加粗斜体的原因。第三步DelimiterProcessor 决定包成什么处理器接口定义在 delimiter_processor.cj内置的加粗/斜体处理器在 inline.cj 中实现两个细节特别值得新手注意① 3 的倍数规则CommonMark 规范对内部分隔符串的约束if ((openingRun.canClose() || closingRun.canOpen()) closingRun.getOriginalLength() % 3 ! 0 (openingRun.getOriginalLength() closingRun.getOriginalLength()) % 3 0) return 0 // 放弃本次匹配留给下一轮② 一次最多消耗 2 个分隔符两端都 ≥2 个时生成StrongEmphasis加粗否则生成Emphasis斜体并把两端的 Text 节点之间的所有子节点搬进新节点同时记录源跨度SourceSpans以便定位高亮。删除线用扩展机制接入同一套匹配流程 ✂️删除线不是 CommonMark 标准语法而是项目内置的扩展插件源码在 strike_through.cj。它只需三步就复用了上面的整个匹配流程实现StrikethroughDelimiterProcessor声明开/闭字符为~最小长度默认为 2~~在process()中校验开闭长度相等且 ≤2与 GitHub 行为一致然后把中间节点包进Strikethrough节点通过 StrikethroughExtension 把处理器注册到 ParserBuilder并同时提供 HTML / 纯文本两种渲染器。想扩展自己的行内语法照着这个插件抄一遍即可接口文档详见 doc/feature_api.md。想动手研究从这几个文件入手 关注点文件分隔符数据结构与开/闭标记src/commonmark/delimiter_run.cj处理器接口与阶梯式路由src/commonmark/delimiter_processor.cj加粗/斜体匹配与 3 倍数规则src/commonmark/inline.cj核心匹配算法 processDelimiterssrc/commonmark/inline_parser_impl.cj删除线扩展实现src/strikethrough/strike_through.cj测试用例可跑通验证test/LLT/delimited_test.cj一句话总结commonmark4cj 的行内解析把看见符号先入栈、看到闭合再回扫、交给处理器包装这三步做成了可扩展的管线——理解了这个分隔符匹配机制加粗、斜体、删除线乃至你自己扩展的语法就都水到渠成了。【免费下载链接】commonmark4cj符合CommonMark规范的Markdown解析库项目地址: https://gitcode.com/Cangjie-TPC/commonmark4cj创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表