双语站常见两种失败:只改语言代码的薄弱镜像,或两语渐渐讲出不同产品故事。本 Research Note 观察 paladini/generative-engine-optimization-basic-guide(MIT)——静态双语入门 GEO 学习站——的公开设计事实,并用自己的话写给要建有来源 EN/ZH(或其他)配对的团队。仅事实归因;我们不复制其指南正文。
以可抓取静态 HTML 为产品
该仓库以 GitHub Pages 静态站发布:重要教学内容在 HTML 中,而不是锁在仅客户端渲染墙后。贡献指引强调初学者可读、一手来源、可抓取内容、紧凑可引用块。图示保留 Mermaid 源与已提交 SVG,以便 Pages 无需构建步骤即可发布。
审计者应看到优先级:意义与来源优先,然后是可发现性元数据,再是打磨。这能抵抗「页面没说的主张却硬加结构化数据」的诱惑。
语言目录设计
公开树布局使用英文根指南与 lang/pt-br/ 下的巴西葡萄牙语路径;贡献规则要求译文保留含义(非逐字结构)、术语一致,并在链接、来源、图示与例子上对齐。新增语言时须更新 sitemap 与 hreflang。
对 Mika 类站点可迁移的模式:一个概念 → 每种语言一个 URL → 显式备用链接 → 共享事实清单。不要为「覆盖关键词」在每种语言里发明多余 URL。并行页应用本地自然文案回答同一问题,证据骨架保持一致。
元数据与发现文件
可观察产物包括 sitemap.xml、robots.txt 与 llms.txt。llms.txt 的表述很谨慎:把它当作给 AI 工具的可选站点指南,而不是爬虫权限文件;访问控制仍看 robots 与平台爬虫文档;用 sitemap 做规范 URL 发现;在给 SEO/GEO 建议前,用一手来源核对平台主张。
这种分离对任何双语资产都有用。语言切换与 hreflang 告诉搜索系统哪个 URL 对应哪个地区语言;robots 仍管抓取许可;若发布 llms.txt 式地图,应指向真实规范页,而不是发明第三套内容平面。
把校验当编辑 CI
公开校验脚本检查必需文件、页面元数据、canonical 与 hreflang、JSON-LD、锚点、图示引用、sitemap 配置与 JavaScript 语法。把这些检查当合并门槛,双语漂移才不会变成静默生产事故。
Mika 的等价纪律更小但类似:Research Note 上线前须有可见来源、匹配的中英配对,以及诚实的非承诺措辞。
诚实也是功能
项目公开定位写明:解释 GEO,但不承诺排名、流量、AI 引用或保证可见度。贡献示例对比清楚、有出处的句子与「统治 AI 搜索」式炒作。对有来源双语站,这种诚实必须被翻译过去——不能一语克制、另一语吹大。
与 Mika 中英知识车道的对照
- 英文放在
/knowledge/{slug}/,中文放在/zh/knowledge/{slug}/,互指 hreflang;若政策如此,以英文为x-default。 - 共享同一事实骨架与来源面板;本地化语气,不本地化证据。
- 文章正文优先静态 HTML,让审计与代理看到的文本与人读到的一致。
- 拒绝为操纵排名而批量制造近重复翻译页的工厂。
研究 MIT 学习站不等于 Mika 克隆了它。我们认同的是耐久架构:语言对齐、元数据可校验、一手来源,以及在不确定下保持谦逊的主张。