7月17日,在2026世界人工智能大会暨人工智能全球治理高级别会议上,由中国科学院文献情报中心主导建设的"敖仓·科技语料库"正式对外发布。该语料库通过整合大量科学数据、科技论文、发明专利和科技图书等资源,构建了一个能够让人工智能系统充分理解的海量数据集合。
在当前快速发展的AI技术推动下,科技创新正在经历前所未有的变革。高质量科技语料库的建设对于促进科研方法创新、加速智能经济发展具有重要的战略意义。
"敖仓·科技语料库"采用了独特的"1+7+N"分层构建模式:包括一个综合性强、多学科融合的国家级总库,七个专业化细分领域数据库,以及多个服务于特定应用场景的数据子库。这一系统涵盖了数学物理、化学化工、天文空间等多个基础学科,并建立了完整的科技语料供给体系。
中国科学院文献情报中心主任曲建升指出,该语料库的特点在于其高知识含量和高语义密度的特性。这种设计不仅能够弥补大语言模型在专业知识方面的不足,还能有效校正逻辑推理中的偏差,确保输出结果符合科学规律和数理逻辑要求。
除了服务于科研工作之外,"敖仓·科技语料库"还在商业航天、低空经济、智能制造、生物医药等多个领域展开了深入应用。未来,这一平台将支持包括元器件选型、超微病理诊断、高速列车外形设计等在内的百余个具体行业应用场景。

观察数据








