奥地利科学院发布Apollo大语言模型,以6亿古希腊词汇训练用于莎草纸残片修复

关键点在于,人的专业判断必须保留。一旦我们彻底依赖 AI 完成历史文献的转录与解读,麻烦就会随之而来。

奥地利科学院于当地时间周三正式发布全球首款面向古希腊语的高级大语言模型Apollo。该模型由奥地利科学院联合法国AI实验室Mistral及科技服务商Sail Reply共同开发,训练素材取自手稿、莎草纸与石刻铭文,总计约6亿个古希腊历史词汇。科研人员可通过聊天机器人界面免费使用该模型。

全球各地高校图书馆保存着数十万份古希腊莎草纸残片,其中不少损毁严重,内容或许已无法解读。对于尚存修复希望的文本,学者只能依靠人工逐条补全缺失词句。传统修复流程要求研究者首先划分单词边界——古希腊文本书写原本没有空格分隔,随后判定文献年代,结合当时社会政治背景查阅参考资料,再斟酌选择合适文字补全缺损部分。伦敦大学学院古典学与历史语言学教授斯蒂芬·科尔文指出,精通古希腊历史且能胜任这类修复工作的专家,全世界寥寥无几。

Apollo试图将这类专业知识整合进模型内部。奥地利科学院历史学家、莎草纸文献研究学者安娜·多尔甘诺夫介绍,当模型识别到荷马文本时,会使用荷马时代的古希腊语进行补充;遇到多利亚方言石刻铭文,则自动切换为多利亚方言。针对破损残缺的文献,Apollo基于统计概率给出可能性最高的词句来填补文本空白。研发团队希望借助该模型帮助学者更快筛选出与自身细分研究方向相关的莎草纸残片,发掘新的研究切入点。

Sail Reply公司合伙人迪米特里斯·弗利塔斯在接受《连线》采访时表示,用这种方式解锁古代知识,放在一年之前还是无法想象的事情。牛津大学收藏着全球规模最大的古代莎草纸藏品,该校古典语言与文学教授阿尔芒·当古尔评价称,如果机器可以提示某处空白有三个备选词汇,将极大加快研究进度。

不过Apollo并不会颠覆学界对古代世界的整体认知。大量莎草纸迟迟没有完成修复,本身就是因为记载的大多是日常内容,包括私人信件、婚约、行政文书。科尔文表示,普通读者或许会以为研究者一下子就能发掘出索福克勒斯几部失传的戏剧,但这并不会发生。尽管如此,该模型仍有助于还原古代日常生活的更多细节,并为现有学术推论提供佐证。当古尔认为,每一次完成一处文本复原,都会为古代世界的知识库增添一小块新内容。

弗利塔斯提出,如果Apollo项目取得成功,这套技术可以方便地迁移到其他古代语言,例如拉丁语、古埃及语,也可以推广到其他需要整理、索引大规模文献资料库的学术领域。人工智能已在不少科研领域交出成果:OpenAI此前宣布旗下AI模型解决了一道延续200年之久的数学难题;谷歌DeepMind利用AI整理出大型数据集,用以分析基因突变如何作用于分子生物学。

也有学者提出顾虑:依靠以概率运算为基础的大语言模型补全古代文献缺损部分,有可能产生错误,进而污染原始历史记录。为规避该风险,Apollo的设计思路是提供多组候选文字方案,最终仍交由学者做出抉择。多尔甘诺夫指出,人的专业判断必须保留,一旦彻底依赖AI完成历史文献的转录与解读,麻烦就会随之而来。

从行业视角看,Apollo代表了垂直领域大语言模型的一条差异化路径:不以通用能力为卖点,而是将特定语料、方言规则与学术工作流深度绑定,以人机协作方式嵌入专业研究场景。这一模式若得到验证,或将为古籍整理、档案数字化、法律文书检索等同样依赖大规模文献索引与专业判断的领域提供可复用的技术框架。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
三星晶圆代工拟扩建4nm与2nm产线,应对HBM基础裸片需求增长
上一篇 1小时前
超频三预告北境 GT360 Max ARGB 液冷:机甲风 CNC 冷头,4" 480p 无边框方屏
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部