Sitemap XML链接提取器
工具用的顺手吗?
你的反馈能帮助我们做得更好
从Sitemap XML代码中提取URL列表,供SEO分析、爬虫抓取或内容审核使用。
输入 Sitemap XML 内容开始提取
概览
了解工具能解决的问题、计算或处理逻辑,以及数据边界。
粘贴含有三个<loc>节点的Sitemap XML,右侧会按原顺序列出三行地址并显示“提取到3个链接”。页面读取的是XML文本内容,而不是访问这些网址;<lastmod>、<changefreq>、<priority>等字段不会进入结果。
普通页面Sitemap以<urlset>为根,每个<url>下的<loc>表示页面地址。Sitemap索引以<sitemapindex>为根,每个<sitemap>下的<loc>表示子Sitemap地址。提取器会收集两类文档中的未加前缀loc节点,因此必须先看根元素,才能判断输出是页面URL还是子地图URL。
结果逐行呈现,与源XML中的loc出现顺序一致,适合复制到文本比较、表格或后续审计流程。
相同loc出现两次,就会输出两行并计为两个结果。重复项本身可能正是需要发现的问题。
字符串看起来像URL即可被列出;页面不会发起请求,也不会检查HTTP状态、重定向、robots规则或搜索引擎收录状态。
合法XML中的&会作为实体解析并在结果文本中显示为&。若XML整体不良构,页面还会尝试从简单的、小写且完整闭合的<loc>...</loc>片段中取值;这只能用于抢救简单片段,不能替代XML校验。
指南
按步骤完成操作,并通过示例核对输入与结果。
输入区需要的是以<urlset>或<sitemapindex>开头的内容,不是https://example.com/sitemap.xml这一条地址。该页面不会根据网址下载文件。
内容进入输入区后会自动解析。字符计数可用于确认长文本是否完整粘贴;“清空”可移除整段输入。
urlset输出通常是页面地址,sitemapindex输出则是下一层文件地址。右侧计数是提取到的条目数,包含重复值。
结果区按一行一个值展示,可使用复制按钮。后续若要检查状态码、规范化URL、去重或抓取子Sitemap,需要在其他审计流程中完成。
普通Sitemap片段:
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url><loc>https://example.com/</loc></url>
<url><loc>https://example.com/about</loc></url>
</urlset>预期得到两行页面地址。若改成<sitemapindex><sitemap><loc>https://example.com/posts.xml</loc></sitemap></sitemapindex>,则只得到子Sitemap地址https://example.com/posts.xml;提取器不会继续打开它。
场景
查看这项工具在不同工作与生活流程中的用法。
把旧站页面Sitemap正文转换成逐行列表,再与新站路由或重定向表比较。先确认输入是urlset,避免把子Sitemap地址误当页面清单。
内容团队可复制结果到表格,筛选测试域名、意外路径或缺失栏目。提取器只负责展平loc,是否应收录仍需结合发布计划判断。
因为输出保留重复项,可在表格或文本工具中计数,找出同一URL为何在源文件出现多次。不要把右侧计数直接当作去重后的页面总数。
问答
集中解答高频疑问与容易混淆的问题。
不可以。输入区解析XML正文,不会请求远程URL。请先从你有权访问的站点获取或查看XML源代码,再粘贴完整内容。
索引文件的loc指向子Sitemap,不是最终页面。当前页面只列出这一层,不会递归下载子文件;需要逐个取得子文件正文后分别提取。
不会。地址按源文档顺序输出,重复节点也会重复显示。这样的原始列表更适合发现源文件问题;需要唯一清单时应在复制后明确去重。
完整解析失败后,简单且小写的成对loc标签仍可能被识别。此时结果只代表找到的文本片段,不能证明XML良构、命名空间正确或所有地址都已提取。
须知
使用前了解适用范围、结果限制与必要提醒。
loc只说明该文本存在于输入内容中,不证明URL可访问、内容可索引或已经被搜索引擎收录。.xml.gz文件,也不导出lastmod等元数据。<sm:loc>、标签使用大写、标签带属性或XML严重破损时,宽松片段提取可能漏项;应优先修复并提交良构XML。urlset/url/loc、sitemapindex/sitemap/loc结构和XML实体转义;核验日期:2026-09-22。推荐
查找相关工具、专题与可用的 API 能力。