蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据
蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据训练一个大模型之前,语料需要经过解析、清洗、去重、质量评分、Token化和样本组装。
搜索
训练一个大模型之前,语料需要经过解析、清洗、去重、质量评分、Token化和样本组装。
近日,开放式耳机领域头部玩家、声学大厂韶音向行业抛出一款颠覆性产品——OpenFit 2 AI开放式耳机,这也是其在AI可穿戴领域的又一次重要布局。在联手千问大模型夯实底座基础上,韶音针对专业场景构建语料库并进行深度定制调优,进而实现高效准确的转录和总结,配合舒适无感的佩戴、旗舰级音频效果,OpenFit 2 AI成为赛道黑马级产品。
Stack Overflow,有「程序员圣经」之称,已经积累超过 2400 万个问题专业社区,全网最大的编程问答语料库,正在走向死亡。
视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。
就在前两天,斯坦福大学等机构发布了一个名为 GPIC(Giant Permissive Image Corpus,巨型开放图像语料库)的数据集。
绝大多数 AI 陪伴产品,都是基于通用模型的使用,利用提示词框架对模型进行定向约束,所以角色的表达仍然停留在「人类平均水平」,本质都是提示词驱动下的角色扮演。但陆弘毅做蕾伊的方法完全不同。团队先为她写了几十万字的人格语料,确定她从小到大的经历、行为与反应、深层性格和内在冲突,再把这些只属于蕾伊的数据灌进他们自研的「超人格化模型」。
别人做AI中训练都在堆语料、补知识。
在检索增强生成中,扩大生成模型规模往往能提升准确率,但也会显著抬高推理成本与部署门槛。CMU 团队在固定提示模板、上下文组织方式与证据预算,并保持检索与解码设置不变的前提下,系统比较了生成模型规模与检索语料规模的联合效应,发现扩充检索语料能够稳定增强 RAG,并在多项开放域问答基准上让小中型模型在更大语料下达到甚至超过更大模型在较小语料下的表现,同时在更高语料规模处呈现清晰的边际收益递减。
近日,来自伊利诺伊大学芝加哥分校、纽约大学、与蒙纳士大学的联合团队提出QuCo-RAG,首次跳出「从模型自己内部信号来评估不确定性」的思维定式,转而用预训练语料的客观统计来量化不确定性,
在代码大模型(Code LLMs)的预训练中,行业内长期存在一种惯性思维,即把所有编程语言的代码都视为同质化的文本数据,主要关注数据总量的堆叠。然而,现代软件开发本质上是多语言混合的,不同语言的语法特性、语料规模和应用场景差异巨大。