大模型测评:最强AI花落谁家?
当前大模型评测面临“高分低能”困境:静态基准如MMLU、GSM8K等易被模型通过记忆刷分,真实能力与分数脱节。多维度评测体系(如MT-Bench、Chatbot Arena)和抗污染动态生成集成为新方向。数据泄露与“教师蒸馏”导致部分开源模型分数虚高,闭源模型在深度推理上仍领先。未来将发展动态评测、自动化评估者及人机协...
找到 75 篇与 "泛化能力" 相关的文章
当前大模型评测面临“高分低能”困境:静态基准如MMLU、GSM8K等易被模型通过记忆刷分,真实能力与分数脱节。多维度评测体系(如MT-Bench、Chatbot Arena)和抗污染动态生成集成为新方向。数据泄露与“教师蒸馏”导致部分开源模型分数虚高,闭源模型在深度推理上仍领先。未来将发展动态评测、自动化评估者及人机协...
通用人工智能(AGI)是AI终极目标,当前主攻规模化(如GPT-4)和认知架构两条路线。多模态理解、工具使用等取得突破,但仍面临符号落地、因果推理、泛化等根本挑战,且伦理安全争议激烈。业界对实现时间分歧巨大,预测中位数为2047年。AGI将渐进到来,技术进步需与伦理监管同步。
大模型与视觉语言模型赋能机器人实现从感知到认知的跨越,提升自然语言理解和泛化能力,但实时性、安全性与计算资源仍是瓶颈。人形机器人备受资本关注,技术挑战包括高成本、动态行走稳定性及自主作业能力有限。具身智能面临仿真到真实的迁移鸿沟,数据获取与闭环是关键。伦理安全需明确责任归属、避免偏见并保护隐私。通用机器人将沿渐进路径发...
谷歌DeepMind与MIT团队提出神经符号过程网络(NSPN),通过可微分逻辑约束层融合神经网络连续表示与符号逻辑离散推理,在GQA、CLEVR等基准上准确率提升超17%,仅需40%训练样本。应用于自动驾驶实现零样本遵守交通规则,违规率降至0.3%;后接大语言模型将事实准确率从78.2%提升至91.5%,同时保持可解...
摘要:2025年汉诺威工博会显示,工业AI正推动制造业从自动化向自主化跃迁。以多模态大模型、生成式AI和边缘智能为核心,AI能自主学习、动态决策,在质检、工艺调优、预测性维护等领域实现突破:误报率降低63%、翘曲率降至0.7%、非计划停机减少47%。尽管面临数据基础薄弱、模型可解释性等挑战,工业AI的终极目标并非无人化...