返回资讯列表
超球面语义轨迹分析:绘制学术预印本、专利信号与算力扩展中的技术扩散图景

超球面语义轨迹分析:绘制学术预印本、专利信号与算力扩展中的技术扩散图景

2026年10月1日作者:AI铺子编辑部
大模型学术

研究团队提出一种名为HSTA的无监督定量方法,旨在解决传统生产力指标滞后的问题。该方法通过分析学术预印本与专利文本,追踪技术扩散并识别范式转变。结果显示,大语言模型等子主题语义演变最快,且论文数量增长并不直接驱动算力扩张。

arXiv:2609.35845v1 公告类型:新发布 摘要:全要素生产率(Total Factor Productivity)等宏观经济生产力指标,由于行政调查周期与国民核算惯例的限制,往往以数年的报告滞后才能反映技术突破。本文提出超球面语义轨迹分析(Hyperspherical Semantic Trajectory Analysis,HSTA),这是一种无监督的定量方法,可直接从非结构化的科学与商业文本流中追踪技术扩散。我们分析了 30,000 条经筛选的文档记录,涵盖来自 arXiv 的学术预印本以及来自 USPTO 的专利申请记录。通过将高维 Transformer 句子嵌入投影到单位超球面,在八个主要子主题上进行 Spherical K-Means 聚类,并结合 UMAP 流形降维,HSTA 形式化了两项定量指标:(1)语义质心向量漂移(Semantic Centroid Vector Drift),用于追踪时间子语料库之间的词汇变化,以识别结构性范式转变;(2)商业化偏移(Commercialization Offset),用于评估科学发现与知识产权申请之间的跨语料库峰值密度对齐情况。通过将季度主题数量速度与来自 Epoch AI 数据库的物理硬件指标相联系,向量自回归(Vector Autoregressive)F 检验表明,仅凭季度论文数量速度,在常规统计显著性水平上并不 Granger 导致前沿算力配置的激增,这凸显了将文本信号以实物资本约束为条件进行处理的必要性。实证结果显示,涵盖大语言模型(Large Language Models,漂移指标为 0.332)与人工智能系统(Artificial Intelligence Systems,漂移指标为 0.234)的子主题经历了最高速率的语义演变,为补充传统经济统计提供了一种客观、实时的机制。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。