- admin 的博客
Border理论小记
- @ 2026-7-10 10:57:54
Border理论小记 更新于 2026/7/8 16:33:34 作者
command_block
部分图源 —— 金策 : 《字符串算法选讲》,2017
看不懂的 Border 论,写不顺的 KMP。
KMP算法
讲个笑话,当教练画了个字符串算法层级图,叫我们尽量使用“低级算法”解决问题,我发现自己不会最底层的 KMP……
作用 : 对于一个字符串 ,对于每个 求出 与 匹配的最大长度。
就是把 的每个前缀与自身匹配,且不能无脑重合,问最长能匹配多长。
例 : ababb
a ab
ababb ababb
匹配上了 0 位 匹配上了 0 位
aba abab
ababb ababb
匹配上了 1 位 匹配上了 2 位
ababb
ababb
匹配上了 0 位
怎么求呢? 回忆AC自动机的内容,发现这个最短不重合可匹配前缀就是 fail ! (手动狗头
但是 AC 自动机的正确建立方法需要补 Trie 图,这玩意就不必如此麻烦了,直接暴力跳 fail ,直到有对应出边即可。
由于跳一次fail,匹配位数必然减少,所以复杂度是均摊正确的。
然后,我们就可以在这个自动机上匹配其他的串,得到每个前缀的匹配长度,同样暴力跳 fail ,复杂度也是均摊的。
可以拿来做单串匹配,给匹配串建立自动机,求出文本串每个前缀的匹配长度。
若某个位置的匹配长度为匹配串串长,则说明完整匹配了。
这题终于不是橙色而是黄色了,感天动地!
生涯第一次 1A 的 KMP /ll
#include<algorithm>
#include<cstring>
#include<cstdio>
#define MaxN 1000500
using namespace std;
void build(char *s,int len,int *fail)
{
int p=0;
for (int i=2;i<=len;i++){
while(p&&s[p+1]!=s[i])p=fail[p];
if (s[p+1]==s[i])p++;
fail[i]=p;
}
}
void match(char *s,char *t,int len,int *fail,int *sl)
{
int p=0;
for (int i=1;i<=len;i++){
while(p&&s[p+1]!=t[i])p=fail[p];
if (s[p+1]==t[i])p++;
sl[i]=p;
}
}
char s[MaxN],t[MaxN];
int tp[MaxN],sl[MaxN],len1,len2;
int main()
{
scanf("%s%s",t+1,s+1);
len1=strlen(s+1);len2=strlen(t+1);
build(s,len1,tp);
match(s,t,len2,tp,sl);
for (int i=1;i<=len2;i++)
if (sl[i]==len1)printf("%d\n",i-len1+1);
for (int i=1;i<=len1;i++)
printf("%d ",tp[i]);
return 0;
}
设模式串为 ,文本串为 。
首先设计一个朴素 ,设 为文本匹配了前缀 ,模板匹配了前缀 的方案数 。
我们只要把 的情况剔除,就能够保证模式串不出现。
设 为已经匹配了长度 ,新加一个字符使得匹配长度变为 的方案数。
则有转移 :
不难发现, 是由模板串唯一确定的。
而上述转移正是矩阵乘法,使用矩阵快速幂即可 计算。
边界是 ,所以答案是矩阵第 行的和。
现在考虑如何算出 。
枚举当前匹配的长度 和即将添加的字符 。
-
多匹配了一位。匹配长度加一。
-
跳回某个前缀,发现能够匹配了。 (和
KMP一样跳 ) -
失配。(跳到根发现仍然无法匹配)
这部分的复杂度是 的。
其实就是 KMP 自动机,所以有 的做法。
- 扩展KMP(Z函数)
给出串 ,定义 。
求 ,即 的所有后缀与 的 。
定义 ,且然有 。接下来按照 的顺序求解。
定义一个 处的匹配段 为 ,维护右端点最靠后的匹配段 。
在计算 时,显然有 。若此时 ,则将 初始化为 然后暴力扩展。
否则由 ,可以利用 的值。若 则表明 。
否则,将 初始化为 ,然后暴力扩展 并更新 。
不难发现,暴力匹配的过程中 一直随之增大,所以总复杂度是 的。
求出 函数之后,可以进一步求解匹配问题,方法类似,具体见代码 :
#include<algorithm>
#include<cstring>
#include<cstdio>
#define ll long long
#define MaxN 20005000
using namespace std;
void zkmp(char *a,int n,int *z)
{
z[1]=n;
for (int i=2,l=0,r=0;i<=n;i++){
z[i]=(r<i) ? 0 : min(z[i-l+1],r-i+1);
while(i+z[i]<=n&&a[i+z[i]]==a[z[i]+1])z[i]++;
if (i+z[i]-1>r){l=i;r=i+z[i]-1;}
}
}
void zmatch(char *a,int na,char *b,int nb,int *z,int *p)
{
for (int i=1,l=0,r=0;i<=na;i++){
p[i]=(r<i) ? 0 : min(z[i-l+1],r-i+1);
while(i+p[i]<=na&&a[i+p[i]]==b[p[i]+1])p[i]++;
if (i+p[i]-1>r){l=i;r=i+p[i]-1;}
}
}
char a[MaxN],b[MaxN];
int z[MaxN],p[MaxN];
void calc(int *z,int n)
{
ll ans=0;
for (int i=1;i<=n;i++)
ans^=1ll*i*(z[i]+1);
printf("%lld\n",ans);
}
int main()
{
scanf("%s%s",a+1,b+1);
int na=strlen(a+1),nb=strlen(b+1);
zkmp(b,nb,z);calc(z,nb);
zmatch(a,na,b,nb,z,p);calc(p,na);
return 0;
}
Border 的一些性质
- Border 相关的定义&约定
用 表示 的长度。若只有一个串, 一般指原串长度。 指字符集。
: 字符串的某个前缀(非原串),能与后缀完全匹配。
如 则称 为一个 。
下面会简称为 。
设 为 的最大 ,而 为 的 集合。
若对于 ,有 ,称 是 的周期。
是 是 的周期

若 称为整周期。
- KMP 与 Border 的关系
能够发现, KMP 的 fail 数组刻画的就是各个前缀的 。
- 求出某个串的所有 Border
当然,你也可以按照定义无脑 Hash,但是这里有个更加有理有据的作法。
-
用人话说, 加上 的 恰是原串所有的 。
-
右侧 左侧 : 的 是 。
若有 且 ,
即 是 的 , 是 的 。
把等式连接,则有 ,所以 是 的 。
如果用图来表示就很直观了 :
原串是 , 是 的 , 是 的 。
$\begin{aligned} &\qquad\qquad\qquad\qquad\boxed{\qquad\qquad B\qquad\qquad} \\&\qquad\qquad\boxed{\qquad\qquad\qquad A\qquad\qquad\qquad} \\&\boxed{\qquad\qquad\qquad\qquad S\qquad\qquad\qquad\qquad} \\&\boxed{\qquad\qquad\qquad A\qquad\qquad\qquad} \\&\boxed{\qquad\qquad B\qquad\qquad} \end{aligned}$
显然 也是 的 。
-
左侧 右侧 : 是 的 。
假设有 , 且 ( 代表最大的 )
即 均是原串的 。
把等式连接,则有 ,所以 是 的 。
图还是那张图。
-
而 必然是原串的前缀,我们先用 KMP 求出所有前缀的 ,然后从 不断跳 fail 即可得到原串的所有 Border 。
的所有 长度 : 。
由于 与周期对应,题意就是求每个前缀的最小非空 。
可以暴力跳 查询所有 ,发现小非空 即为 树祖先最浅非根点,加个记忆化即可。
题意就是求每个前缀 长度一半的 个数。
先跑个KMP,建立一棵 fail 树,问题相当于询问某个前缀 的祖先中 值不超过 的点的个数。
暴力跳fail显然不可取。
-
做法一
注意到长度具有单调性,越往上越短。可以倍增,预处理每个点的“深度”即可得到答案。
很不幸,这不是正解,所以需要卡常。
-
做法二
类似
KMP的Build,在fail上匹配自身,不同的是,若匹配长度超过 则停止,复杂度也是均摊 的。
模板是黄题而本题(简单小应用)是蓝题,充分体现了大多数人只是背了个板子而已 (
对单串建立一棵 树。
前面说过,某个前缀的 集合即为 树上一条到根的链。
那么两个前缀的公共 即为公共祖先,若要求最长,即为 。
还有,本题中 的定义不包括原串,若 与 或 重合,还需向祖先跳一步。
本题数据范围较大,若显式地建立树并递归可能会 MLE。
首先,满足条件的印章一定是个 。
查看该 在原串中的匹配,若完整地覆盖了原串,则可行,否则不可行。
如何求匹配位置呢? 回顾KMP的方法,其实就等价于把 拿到自动机上匹配,若匹配长度达到总长则表明配上了。
又由于 是原串的前缀,我们没必要对每个 都匹配一次,可以直接使用原来的匹配信息(即)。
但是注意,当匹配前缀 时,其在 的匹配长度并非 ,而是 本身(全部匹配)。需要特判一下。
若匹配长度达到当前 长度,则在这里匹配上了。
于是,从小到大枚举每个 ,设为 ,称一个前缀 合法当且仅当 ,即能匹配上。
随着 的增大,会逐渐删除某些位置,我们使用双向链表维护。顺便维护相邻两次匹配位置的最大差值,若 ,则该 可行。
-
关于周期和匹配的一些性质
-
$\text{\color{blue}定理(2) }\text{Weak Periodicity Lemma :}$
若 为 的周期,且 ,则 也是 的周期。(简称为 )
不妨设 ,令 。
当 时,有
当 时,有
而以上两种情况必然包含所有的 。所以, 也是 的周期。辗转相减即可得到 。
强化版 : 也是 的周期。证明不会。
一般用弱化版就够了。
- 若 是 的前缀,且 有周期 , 有整周期 , ,则 也有周期 。
显然成立,看图 :
$\begin{aligned} &\boxed{\qquad\ \ \ {\color{red}|}S\qquad\ |\quad}\qquad\qquad\ \ \ \boxed{\qquad\ \ \ {\color{red}|}S\qquad\ |\quad} \\T:\ &\boxed{\qquad\qquad\qquad|\qquad\qquad\qquad|\qquad\qquad\qquad|\qquad\qquad\qquad|\qquad\qquad\cdots} \\&\qquad\qquad\qquad\ \boxed{\qquad\ \ \ {\color{red}|}S\qquad\ |\quad}\qquad\qquad\ \ \ \boxed{\qquad\ \ \ {\color{red}|}S\qquad\ |\quad} \end{aligned}$
- 若 如下图匹配,则表示 有长度为 的周期。
$\begin{aligned} &\ \boxed{\qquad\qquad\qquad\qquad T\qquad\qquad\qquad\qquad} \\&\ \boxed{\qquad\qquad\quad S_1\qquad\qquad\quad} \\&\xleftrightarrow[\quad \normalsize d\quad]{}\! \boxed{\quad\qquad\qquad S_2\qquad\quad\qquad} \end{aligned}$
有 的 ,也即 的周期。
由于 出现位置刚好相差 ,它们的周期是重合的,所以 也有周期 。
- 若 ,则 在 中的匹配位置必为等差序列。
不妨将 中没有被匹配覆盖到的(前后)部分去掉,这样 中的所有位置都被 的匹配覆盖。
显然,若匹配次数 ,必为等差数列。
下面来讨论匹配次数达到 的情况。设第一,二次匹配间隔长度为 ,之后的某次匹配与第二次匹配的间隔为 。
$\begin{aligned} &\ \boxed{\qquad\qquad\qquad\qquad\qquad T\qquad\qquad\qquad\qquad\qquad\ \ \ } \\&\ \boxed{\qquad\qquad\quad S_1\qquad\qquad\quad} \\&\xleftrightarrow[\quad\ \normalsize d\quad]{}\! \boxed{\quad\qquad\qquad S_2\qquad\quad\qquad} \\&\qquad\quad\,\,\xleftrightarrow[\qquad\quad\ \normalsize q\quad\qquad]{}\! \boxed{\quad\qquad\qquad S_x\qquad\quad\qquad} \end{aligned}$
根据 , 有周期 。
由 有 ,由 得 也是 的周期。
假设 的最小周期为 ,则有 。若 ,由 可以构造出更小的周期,所以 。
由 , ,可得 有周期 。
若 ,则能构造出比 更靠前的匹配(如下图),所以只能是 。
$\begin{aligned} S_1:\ &\boxed{\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\ \ } \\S_?:\ &\quad\ \ \,\,\boxed{\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\ \ } \\S_2:\ &\!\xleftrightarrow[\quad\ \normalsize d \quad]{}\! \boxed{\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\quad\ \ |\ \ } \end{aligned}$
由于 ,所有匹配的循环节都是重合的。又因为匹配覆盖了整个 ,所以 拥有和 一样的(最小)循环节。
$\begin{aligned} &\!\!\xleftrightarrow{\quad\ \ \normalsize d\quad} \\T:\ &\boxed{\qquad\quad|\qquad\quad|\qquad\quad|\qquad\quad|\qquad\quad|\qquad\quad|\quad} \\S_1:\ &\boxed{\qquad\quad|\qquad\quad|\qquad\quad|\quad} \\S_2:\ &\qquad\quad\,\,\boxed{\qquad\quad|\qquad\quad|\qquad\quad|\quad} \\S_3:\ &\qquad\quad\,\,\qquad\quad\,\,\boxed{\qquad\quad|\qquad\quad|\qquad\quad|\quad} \\S_4:\ &\qquad\quad\,\,\qquad\quad\,\,\qquad\quad\,\,\boxed{\qquad\quad|\qquad\quad|\qquad\quad|\quad} \end{aligned}$
现在不难发现此时的匹配一定是等差序列。
-
关于 Border 的一些性质
-
的长度达到 的 长度构成一个等差序列。
设长度最大的 为 ,另一个 长度为 ,且均有 。
由 得 也是 的周期,所以存在长度为 的 。
根据 为最长 的假设,要满足 即 。( 也就是等差了,公差为 )
整个等差序列的存在性由周期不难证明。
- 一个串 的所有 按长度排序后,可以被划分成 个等差序列。
首先,将该串的长度达到 的 划分成一个等差序列。
考虑长度达到 的 中长度最小的 。
若最小循环节 ,不断从最长 减去 则必然有 。
若 ,则最长 本身就 。
由 ,其余的 都是 的 ,问题缩小至原来的 规模。
如此缩小, 轮就结束了。实际上,有更紧凑的界 ,证明从略。
一个达到上界数量级的简易构造 : $\begin{aligned}&\texttt{abacabadabacaba}\\&\texttt{abacaba}\\&\texttt{aba}\\&\texttt{a}\end{aligned}$
由上面的证明不难发现,这些等差序列的公差是成倍增长的,所以又有推论 :
-
一个串 公差 的 等差序列总大小是 的。
-
例题 :
显然,题目需要求的东西就是 的和。
由于保证相邻段字母不相同,所以只能一段段匹配,不存在一段配两段的情况。
而且,除了头和尾,其余的必须完整匹配。
考虑把每一段压缩成一个二元组。如 ,可以压缩成 。
压缩后的 定义为二元组字符串的 ,而 定义为各个前缀完整匹配的 长度(加权的 )。
对于上例,。 注意,我们认为 和 不匹配。
考虑加上一个二元组 时如何计算贡献。
首先计算出压缩后的 。
一路跳 ,查看对应的出边 ,若 ,匹配长度 对 取 。最终 的值不能超过 。
最后,这一段的贡献是以 开始的,长度为 的,公差为 的等差数列。高斯求和即可。
然而,本题要求可持久化,每次暴力跳 复杂度是均摊的,可能会被卡到 。
-
做法一 : 可持久化
KMP自动机。回忆我们建立 自动机的过程,暴力跳 复杂度同样不对,但是我们把 自动机补全成 图,做到真正的 转移,复杂度就正确了。
类似地,我们可以预处理出每个位置的每个字符出边到达的点,称之为
KMP自动机。在
KMP自动机上,可以 转移至原来需要暴力跳 才能到达的位置。由于字符集较大,不能直接暴力写出所有转移。
build的过程 : 相当于从上一位的 的某个对应出边,作为该位置的 。从父亲处拷贝所有转移,然后修改某一个,这可以使用可持久化线段树维护。
然后再维护答案,对于每种字母,维护对应的匹配最长段长度。这可以直接与父亲取 。
综上,可持久化线段树维护即可。复杂度 。
-
做法二 :
Border树。我们需要为 寻找复杂度较为严格的做法。
回忆 : 的长度可以被划分成 个等差序列。
我们跳 的过程实际上就是在遍历 ,若当中有一串等差序列,那么中间夹着的部分一定是“循环重复”的。
既然是重复的,那也就没必要全部查看,只需要查看最长的,然后直接跳至下一个等差序列即可。
每次跳 的次数严格 ,总跳跃次数就是严格 的。
若需要可持久化,使用可持久化数组即可。复杂度 。
注意到本题并没有要求强制在线,可以将操作树离线下来,将问题转化成一系列的修改和回退操作。
最终采用做法二的离线版本,复杂度为 。
-
最小后缀 Significant Suffixes
-
记 为 的后缀集合。
记 为 的最小后缀。
记 为 ,意思就是说,在 后面加一个串之后,可能称为最小后缀的后缀。即 ,简称为 。
-
对于任意两个 , 是 的前缀。
若 并非 的前缀,无论向串后面加怎样的 , 和 的大小关系还是由 的大小关系决定。
所以 只有一者有可能是 ,矛盾。
注意, 同时也是 的后缀,所以 是 的 。
- 若串 有两个 满足 ,则
假设 ,由 可得 是 的 。
即对应长度为 的周期。设一个周期为 ,令 。
假设在后面加了 (可空) 后,有 即 ,则 ,所以 注定不可能是最小后缀,矛盾。
推论 :。
- 例题 :P5211 [ZJOI2017]字符串 | Sol