来源丨机器之心 DeepSeek 在海内外搅起的惊涛巨浪,余波仍在汹涌。 当中国大模型撕开硅谷的防线之后,在预设中总是落后半拍的中国 AI 军团,这次竟完成了一次反向技术输出,引发了全球范围内复现 DeepSeek 的热潮。 DeepSee…
声浪
吴恩达最新推出的 Agentic Object Detection(智能代理目标检测),是一种全新的 基于推理驱动的目标检测(Reasoning-driven Object Detection) 方法。这种方法能够以类似人类的方式,通过文本…
本文深入探讨了DeepSeek大模型的核心技术,从公司背景、模型能力、训推成本到核心技术细节进行了全面分析。 一、关于DeepSeek公司及其大模型 1.1 公司概况 DeepSeek 2023年7月成立于杭州,是幻方量化旗下的子公司,全称…
来源丨魔搭ModelScope社区 Janus-Pro是DeepSeek最新开源的多模态模型,是一种新颖的自回归框架,统一了多模态理解和生成。通过将视觉编码解耦为独立的路径,同时仍然使用单一的、统一的变压器架构进行处理,该框架解决了先前方法…
来源丨机器之心 Jeff Dean:一次生成就能出正确代码。 在 DeepSeek 的强烈攻势下,这次轮到谷歌坐不住了。 本周三,该公司全面发布 Gemini 2.0 Flash、 Gemini 2.0 Flash-Lite 以及新一代旗舰…
来源丨智驻未来 本文将深入剖析DeepSeek蒸馏技术的核心原理、创新策略以及未来发展方向,带你一探究竟,领略AI模型优化的奥秘与魅力(文末附“DeepSeek-V3 技术报告”下载方式)。 1. DeepSeek蒸馏技术概述 1.1 蒸馏…
如何让机器人在任务指引和实时观测的基础上规划未来动作,一直是具身智能领域的核心科学问题。然而,这一目标的实现受两大关键挑战制约: 模态对齐:需在语言、视觉和动作等多模态空间中建立精确的对齐机制。 数据稀缺:缺乏规模化、多模态且具备动作标签的…
白小交 发自 凹非寺量子位 | 公众号 QbitAI 陈丹琦团队又带着他们的降本大法来了—— 数据砍掉三分之一,大模型性能却完全不减。 他们引入了元数据,加速了大模型预训练的同时,也不增加单独的计算开销。 在不同模型规模(600M - 8B…
来源丨机器之心 刚刚,X 上的一则推文受到了大家的广泛讨论,浏览量迅速增长。原来,OpenAI 发布的 GPT-4o-mini 居然是一个仅有 8B 参数的模型? 图源:https://x.com/Yuchenj_UW/status/187…
作者列表:冯腾飞,何亮* 单位:新疆大学计算机科学与技术学院、新疆信号检测与处理重点实验室、清华大学电子工程系 研究背景 在自然语言处理领域,基于知识库的问答(KBQA)是一项具有挑战性的任务,涉及从结构化知识中准确检索答案。现有的方法要么…
