奥地利科学院联合 Mistral 发布古希腊语大语言模型 Apollo,用于修复莎草纸残片

IT之家(RSS)·2026-09-22 17:42·1小时前
AI 导读

奥地利科学院联合 Mistral 和 Sail Reply 开发的大语言模型 Apollo 将于当地时间周三正式发布,面向古希腊语文献修复,训练素材涵盖手稿、莎草纸与石刻铭文,总计约 6 亿个古希腊历史词汇。

IT之家(RSS)
52AI 编辑部评分,满分 100

奥地利科学院联合 Mistral 发布古希腊语大语言模型 Apollo,用于修复莎草纸残片

2026-09-22 17:42· 1小时前
AI 导读

奥地利科学院联合 Mistral 和 Sail Reply 开发的大语言模型 Apollo 将于当地时间周三正式发布,面向古希腊语文献修复,训练素材涵盖手稿、莎草纸与石刻铭文,总计约 6 亿个古希腊历史词汇。

IT之家 9 月 22 日消息,据 《连线》(WIRED)报道,全球各地高校图书馆保存着数十万份古希腊莎草纸残片,不少残片损毁严重,其内容或许已无法解读;对于其余尚存修复希望的文本,学者只能依靠人工逐条补全缺失的词句完成复原。为加快这项繁重的工作,研究人员开始借助人工智能。

奥地利科学院将于当地时间周三正式发布了全球首款面向古希腊语的高级大语言模型。该项目由奥地利科学院联合法国 AI 实验室 Mistral 以及科技服务商 Sail Reply 共同开发,命名为 Apollo。这套模型的训练素材取自手稿、莎草纸与石刻铭文,总计大约 6 亿个古希腊历史词汇。

据IT之家了解,科研人员可以通过聊天机器人界面免费使用该模型。研发团队希望借助 Apollo 帮助学者更快筛选出和自身细分研究方向相关的莎草纸残片,发掘出新的研究切入点。针对破损残缺的文献,Apollo 会基于统计概率给出可能性最高的词句来填补文本空白,有望挖掘出此前被掩盖的历史事件与古代社会习俗细节。

Sail Reply 公司合伙人迪米特里斯 · 弗利塔斯(Dimitris Vlitas)接受《连线》采访时表示,用这种方式解锁古代知识,“放在一年之前还是无法想象的事情。”

在此之前,修复残破莎草纸完全依赖资深学者:首先要划分单词边界 —— 古希腊文本书写原本是没有空格分隔的;之后还要判定文献年代,结合当时的社会政治背景,查阅各类参考资料,斟酌选择合适文字补全缺损部分。伦敦大学学院古典学与历史语言学教授斯蒂芬 · 科尔文(Stephen Colvin)谈道:“精通古希腊历史、能够胜任这类修复工作的专家,全世界寥寥无几。”

而 Apollo 已经把这类专业知识整合进模型内部。奥地利科学院历史学家、莎草纸文献研究学者安娜 · 多尔甘诺夫(Anna Dolganov)介绍:“当它识别到荷马文本,就会使用荷马时代的古希腊语进行补充;遇到多利亚方言石刻铭文,就自动切换为多利亚方言。”

长期深陷艰苦文本复原工作的学术界期待 Apollo 能够提升研究效率,让学者把精力放在分析古代文献背后的历史意义,而不再耗费大量精力辨识残缺文字本身。

牛津大学收藏着全球规模最大的古代莎草纸藏品。该校古典语言与文学教授阿尔芒 · 当古尔(Armand D'Angour)评价:“这件事令人十分振奋。如果机器可以提示我‘该处空白有这三个备选词汇’,能够极大加快研究进度。”

不过 Apollo 并不会颠覆学界对古代世界的整体认知。大量莎草纸迟迟没有完成修复,本身就是因为记载的大多是日常内容:私人信件、婚约、行政文书。科尔文表示:“普通读者或许会以为我们一下子就能发掘出索福克勒斯几部失传的戏剧,但这并不会发生。”尽管如此,该模型依旧有助于还原古代日常生活的更多细节,并且为现有的学术推论提供佐证。正如当古尔所说:“每一次完成一处文本复原,都会为古代世界的知识库增添一小块新内容。”

弗利塔斯提出,如果 Apollo 项目取得成功,这套技术可以很方便迁移到其他古代语言,例如拉丁语、古埃及语;也可以推广到其他需要整理、索引大规模文献资料库的学术领域。人工智能已经在不少科研领域交出亮眼成果:OpenAI 此前宣布旗下 AI 模型解决了一道延续 200 年之久的数学难题;谷歌 DeepMind 利用 AI 整理出大型数据集,用以分析基因突变如何作用于分子生物学。

也有人提出顾虑:依靠以概率运算为基础的大语言模型补全古代文献缺损部分,有可能产生错误,进而污染原始历史记录。为规避该风险,Apollo 的设计思路是提供多组候选文字方案,最终仍然交由学者做出抉择。多尔甘诺夫指出:“关键点在于,人的专业判断必须保留。一旦我们彻底依赖 AI 完成历史文献的转录与解读,麻烦就会随之而来。”

来源:IT之家(RSS)· ithome.com