最新发布
Zing:从心理学评测到运行时外挂,大模型如何补齐“社交心智”?
这篇题为《Zing: Social Mind for LLMs》的技术报告,系统性地提出了面向大模型“社交心智”(Social Mind)的完整工程与算法方案:代号为 知境 (Zing)的体系。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
这篇题为《Zing: Social Mind for LLMs》的技术报告,系统性地提出了面向大模型“社交心智”(Social Mind)的完整工程与算法方案:代号为 知境 (Zing)的体系。
PAPER INSIGHTS
来自中国科学院自动化研究所、北京大学、美团及伦敦大学学院的研究团队,在一项最新研究中提出了名为 UniMem 的自路由记忆框架。该框架受人类大脑互补学习系统(Complementary Learning Systems...
针对端侧 Agent 在算力成本、可靠性与云端协同之间的多重冲突,研究团队提出了名为 TSDS (Think Short, Defer Smart,意为“短思考、巧转交”)的协同框架。
为了填补这一评测空白,最新研究提出了 SciExplore 。该基准将真实的科研信息搜寻抽象为一个渐进的认知阶梯,涵盖跨 10 多个学科的 103 项博士级深度任务,系统性评测大模型从最底层的实体推理到顶层的领域级结构...
SceneActBench 摒弃了纯文本问答与粗粒度成败反馈,直接构建了一套端到端的无头 Blender 执行评测回路。整个评测回路高度标准化且对环境实施了严格的“防信息泄漏”处理。原始资产往往会在文件命名、初始坐标或...
为了打破这一困局,研究团队将技能进化重构为一个在探索与利用之间寻找平衡的受限马尔可夫决策过程(MDP),并提出了全新的进化框架 SkillBoost 。在涵盖复杂代码生成、多轮工具调用、高难度数学推理、具身交互及多模态...
北京邮电大学、南洋理工大学以及国网辽宁省电力有限公司的研究团队在论文《PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems》...
针对这一瓶颈,研究人员提出了 PoTRE(Poly-Topological Reasoning Ensembles)框架。该工作受到人类“认知异质性”(Cognitive Heterogeneity)的启发,认为复杂难...
最新提出的 PATS (Policy-Aware Training Scaffolding)框架提供了一种截然不同的解法:它不再把外部技能当成推理资产,而是将其重构为 随模型能力演化、在部署时完全剥离的“动态训练脚手架” 。
来自复旦大学、伦敦玛丽女王大学与中关村学院的联合研究团队提出了 OrchBench ,这是首个通过确定性仿真(Deterministic Simulation)将多智能体编排决策与实际执行完全解耦的评测基准。
微软提出的 Mage-VL 试图从根本上颠覆这种帧级离线处理范式。它借鉴了现代视频编解码器与生物视觉的双系统机制,构建了一套“编解码原生(Codec-Native)”的流式多模态基座模型。
来自大连理工大学、哈尔滨工业大学、香港科技大学、上海人工智能实验室、深圳河套学院以及香港中文大学等机构的联合研究团队,针对这一长期被忽视的痛点,提出了专为化学自驱实验室设计的机器人故障分析框架 LabRobFail 。
来自马萨诸塞大学阿默斯特分校(UMass Amherst)的研究团队在论文《Kalypso: Relational LLM Serving》中提出了破局方案。该研究定义了“关系型 LLM 推理”(Relational ...
来自 ELLIS、UIUC、Together AI 以及德克萨斯大学奥斯汀分校等机构的联合研究团队,在最新论文中揭开了这一缺失的优化层,并提出了一种专为后训练量身定制的新范式:等谱优化(Isospectral Opti...
当业界试图通过堆叠更大的参数量和海量视频来“强行内化”物理规律时,来自马萨诸塞大学等机构的研究团队提出了一条截然不同的解决路径: 不要让基础模型去硬猜物理规律,而应当让它扮演数字化身,以“代码”为媒介,直接调度确定性的...
为了打破这一僵局,来自新加坡政府技术局(GovTech)、哈尔滨工业大学与新加坡管理大学的研究团队提出了 VulAgentRL。该框架没有盲目依赖更长的上下文窗口去粗暴内联调用图,而是将漏洞挖掘形式化为一个具备主动工具...
为打破这一死结,研究团队提出了针对 Agent 端到端金融估值建模的全新评测基准 GAUGE 。该基准不再依赖单一分析师的单点数值,而是构建了基于行业实践分布的“三层观察实践包线”(Observed-Practice ...
FilmBench 的提出,标志着视频生成的评测重心正从“普通网民视角的可用性”迈向“专业创作者维度的严苛性”。通过将北京电影学院的视听语言训练体系与前沿 AI 评测技术结合,该基准为模型研发者提供了一面直面工业缺陷的镜子。
针对这一痛点,中国科学院信息工程研究所等机构的研究团队提出了名为 DocOps 的可验证基准测试框架。该框架将真实办公场景中的文档操作拆解为多层级的能力维度与工作流梯度,并引入了严格基于原生文档结构的代码化确定性验证机制。
为了打破这种“能力虚标”的死循环,一项针对智能体评测有效性的研究正式提出了 协议有效性(Protocol Validity) 的理论框架,并开发出无需人工盯梢的事后审计系统 HackDetect 。
来自佛罗里达州立大学(Florida State University)的研究团队在一篇前沿工作中直击这一痛点,提出了 ConsistencyGate 。这是一个基于自洽性(Self-Consistency)准入控制的...
这项工作将这一现象定义为 语义物化 ( Semantic Materialization ),并系统性地提出了面向稀疏事件 KV 服务的“内存契约”(Memory Contract)。