在2026年世界人工智能大会期间,一项名为"敖仓·科技语料库"的国家级科技基础设施正式亮相。这一项目由中国科学院文献情报中心主导建设,标志着我国在推动人工智能技术发展方面取得了重要进展。
科技语料的建设与应用被认为是推动科学创新的关键因素。通过整合多模态科研数据和文献资料,进行深度分析与关联融合,可以生成高知识密度的智能就绪数据,这将直接影响人工智能在科学研究中的应用效果。中国科学院文献情报中心主任曲建升指出,中科院凭借其庞大的科学数据储备、全面的科技文献保障体系以及跨学科的专业化处理能力,为该项目的实施奠定了坚实基础。
截至目前,"敖仓"系统已经整合了海量的科研资源:包括超过320PB的科学数据、1.5亿篇科技论文、1.2亿项发明专利和500万本科技图书,并支持文本、图像、公式、化学式等多种数据类型。该语料库采用"1+7+N"的分层架构,即一个覆盖全学科的数据融合中心,七个专业领域深入研究的分支数据库,以及多个服务于具体应用场景的子库。这样的结构使得数学物理、化学化工、天文空间等领域的科研工作都能获得相应的支持。
除了在学术研究中的应用外,"敖仓·科技语料库"还在商业航天、低空经济、智能制造和生物医药等领域发挥了重要作用。未来,它还将支持元器件选型、超微病理诊断、高速列车外形设计等多个行业的创新发展。
项目负责人表示,"敖仓·科技语料库"将遵循开放协作的原则,持续提升数据处理能力,促进科技语料生态的建设,为全球科技创新提供有力支撑。这一国家级项目的成功实施,不仅提升了我国在人工智能领域的研究水平,也为全球科研合作与技术进步贡献了中国智慧。

观察数据








