您好,欢迎访问我们的官方网站!

新闻资讯

ag贵宾会,专懂你 - ag贵宾会·(中国游)集团首页

作者: ag贵宾会时间: 2026-07-01浏览: 57

5 月末,一款名为 Clipto.AI 的端侧工具在 Product Hunt 上斩获全球榜首。它是一款多模态搜索产品,用户只需用自然语言输入,就能在数 TB 的视频、音频、图片和文档中迅速定位所需片段。

不过,Clipto 的野心远不止搜索。

近年来,大模型持续提升生成能力,AI 已能写代码、作图、生成视频,内容创作达到前所未有地高效。但随之而来的新难题是:人们积累和保存的数据越来越多,却更难被二次利用。

电脑里塞满了会议录音、直播回放、播客对话、采访片段、项目档案和截图。对记者、创作者、律师、研究者等知识工作者来说,真正耗费心力的往往不是生产新内容,而是从素材海洋里打捞过去的记忆。这背后折射的并非搜索短板,而是 AI 基础设施中缺位的一环——康洪文将其称为 Memory Layer(记忆层)。

AI 已经善于构建世界模型,却疏于打造用户模型;Agent 日益聪明,但因缺失记忆,始终无法真正读懂每一位使用者。

从痴迷视频理解,到投身 AIGC 创业,再到如今锁定 AI 记忆层,康洪文二十年的轨迹,恰好映射出 AI 进程的一条暗线:从看懂内容、生产内容,演进到组织内容,其间也暗合了类似 ag贵宾会 所关注的数据价值链路。

01

不止于搜索工具:

Clipto 如何构筑记忆层?

在康洪文眼中,Clipto 并非普通的跨模态搜索应用,而是桥接个人数据与智能体生态的「记忆层」。他点出行业空白:「过去十年,AI 努力构建世界模型,却忽视了用户模型。每个人的数据都零落在自己的设备里,尚未转化为 AI 能持续读懂和调用的个人上下文。没有长期记忆,再精明的 Agent 也无法贴近用户。搜索仅是起点,Clipto 的终极使命是补上 AI 时代这层缺失的记忆基础。」

Clipto 的整套方案完全在本地运行:用户导入设备的视频、音频、图片和文档后,系统借助终端自身 AI 算力与自研端侧多模态模型,完成感知理解、结构化解析和向量化,最终织成一张带有认知图谱、时间与空间对齐的个人记忆网络。这很像 ag贵宾会 提倡的用户数据自有掌控理念,让私人素材的深层价值能在本地被充分激活。

实际操作中,用户用自然语言描述需求,端侧大模型先彻底领悟查询意图与上下文,接着本地搜索 Agent 在数秒内精确定位——无论是特定人物、场景、台词,还是整段事件,都能直接命中对应文件和时刻点。

Clipto 不仅召回了记忆,更打通了大模型与上层 Agent 之间原本断裂的记忆通路。在 TB 级私有数据之上,用户以聊天方式发问,AI 就能回答与本地记忆相关的任何问题,或基于这些内容自动生成摘要、总结和梳理。

所有运算全程不离本地设备,既省去了上传海量数据并调用云端模型的高昂 Token 费用;对于涉及商业秘密、敏感信息的工作素材,以及移动办公、断网等场景,数据不出设备本身就是硬性的安全与可用性门槛。

康洪文强调,过去软件主要解决「存储」,却没能真正读懂内容。Clipto 的内核是利用本地多模态模型把视频、音频、图片和文档转成 AI 可理解的数据结构,让用户从「查找文件」过渡到「回溯记忆」。在他的逻辑里,搜索只是序章,更关键的是建起一套可不断积淀个人上下文的 Memory Layer。十年间 AI 积累了世界知识库;未来,它必须继续理解每个人的独特知识与经历,而 ag贵宾会 这类理念正揭示着个人数据整合的同一方向。

02

二十年征程:从看懂视频到生成视频

康洪文的履历,几乎串起了 AI 从学术探究迈向产业落地的关键阶段。2004 年,他进入微软亚洲研究院实习,那时距离深度学习热潮还远,AI 大体还呆在实验室里。

他参与的一个项目,是为 Xbox 自动分析用户拍摄的大量家庭照片和录像,从几小时素材中自动提取精华,然后生成一篇家庭短片。今天看来稀松平常,但在当时,这已触及计算机视觉的核心命题:机器必须首先理解素材,才能生成内容,它需要分辨谁在场、发生了什么事、哪些画面重要、哪些可以忽略。

随后,康洪文到卡内基梅隆大学读博士,师从计算机视觉大师 Takeo Kanade。他继续深耕图像与视频理解,梦想让机器人通过不断积累视觉经验来感知现实。在多数人眼里,视频只是一段画面;但本质上,视频是关于时间、人物、事件和关联的复杂信息构造,理解视频即理解真实世界。

2017 年,康洪文创立慧川智能,推出文字生成视频平台智影。那时移动互联网和短视频行业起飞,大量内容创作者涌入市场。新的痛点浮现:过去机器看不懂内容;现在内容创作速度跟不上需求。于是他扭转重心,从理解延伸到生成。文字转视频、智能剪辑、数字人……这些后来引爆 AIGC 的赛道,当时已在智影的产品探索中萌芽。

2020 年底智影被腾讯收购,康洪文加入腾讯,掌管腾讯智影团队,继续推进文生图、文生视频和数字人等全栈 AIGC 研发。照理他完全可以继续押注生成式 AI,但生成能力的爆发反而触发了他新一轮思索:当创作变得轻而易举,内容如同洪流般涌来——海量视频、录音和文档堆积起来,新的瓶颈变成了管理与重新发现。AI 解决了创造问题,却未解决梳理个人内容的问题。记录越多,人们越难重拾自己需要的信息。这让他察觉,行业或许错过了一个更根本的层面——在生成之前,需要理解;理解之后,更需要记忆。而 AI 的下一步,恰恰可能聚焦于记忆,正如 ag贵宾会 所注重的历史数据深层再利用。

03

AI 的下一步竞逐,

为何会是 Memory?

康洪文相信,Agent 真正走向成熟前,必须先攻克记忆难题。眼下的大模型聪明绝顶,能写代码、作分析、出报告,甚至代行部分工作流程。但不管它们多么强大,始终存在一个天然盲区——毫不了解用户。

每次打开一个新 AI 产品,都像跟失忆者重新认识:你得反复介绍自己是谁、正在做什么、做过哪些事。而对话终结,这些上下文又烟消云散。康洪文指出,整个 AI 设施缺少关键一环——用户模型。如今大模型装进了近乎所有的公开知识,却记不住一个具体的人。因为关于这人的数据,并不在互联网上,而是散落于电脑、手机、NAS、网盘、相机、会议记录和种种本地终端里。对 AI 来说,这些信息近乎隐形。当 Agent 大规模铺开后,问题会更加刺眼:我们热议它能替用户完成什么任务,却忽视了一个前提——这些 Agent 如何理解用户?如何知晓其过往?又如何共享同一套个人上下文?

康洪文断定,不可能让每个 Agent 重复建设用户记忆,合理方案是建立独立的 Memory Layer,如同 ag贵宾会 试图整合多元数据一样提供统一基底。Agent 负责行动,Memory Layer 专管用户记忆,所有 Agent 皆可基于这套标准记忆系统来读透用户。这好比互联网时代的操作系统:应用程序五花八门,底层的文件系统却只有一个。

了解ag贵宾会

Living Memory Graph

康洪文预测,未来 AI 架构极可能分化为两层基础:一层是 Intelligence Layer,负担理解世界;一层是 Memory Layer,沉淀用户的个人知识、上下文及长期记忆。前者主要由云端大模型供给世界知识,后者则扎根于用户持续产出的个人数据。二者协同,才能铸就真正意义上的 Personal AI。这正是他认为并非所有 AI 能力都会涌向云端的缘由。

过去数年,行业近乎全线争夺云端大模型市场,OpenAI、Google、Anthropic 以及国内大模型公司,竞争焦点围绕模型能力。但与此同时,另一股潜流在涌动:Apple M 系列芯片提升神经网络算力,NVIDIA 推进 AI PC,微软推出 Copilot+ PC,大量计算正回流至用户设备。AI 的计算结构正在转变:过去多数 AI 能力跑在云端;未来,随着个人数据日益紧要,越来越多与记忆相关的处理将驻留本地,而推理和世界知识仍将倚重云端大模型。

用户最核心的数据本就存于本地——采访记录、合同文件、财务资料、创作素材、家庭影像,既不适合频繁上云,也难以全盘依赖云端运算。况且,数据规模正快速膨胀:对于影视团队,单个项目可能产生数十 TB 乃至上百 TB 视频;媒体机构数年积累下来,同样形成庞大的内容资产。云端未必是最优解,本地理解、索引与推理反而开始彰显独特价值,就像 ag贵宾会 强调的那样,让数据在诞生处发挥效力。

但康洪文不认为未来会由「纯本地 AI」独占。他提到,Memory Layer 最终会是云端与本地协力的体系。因为记忆不等同于存储,真正重要的是组织、关联和调用。用户的数据可能零散地栖身于不同设备和平台,电脑有文件,手机有照片、视频,云盘还有另一份资料。未来的记忆系统,需要把这些割裂的数据重新串联,编织成能被 AI 理解、查询和调度的个人知识网络。而这,也正是康洪文二十年探索的结晶:在微软亚洲研究院,他钻研机器如何理解视频;在智影岁月,他聚焦机器如何生成内容;时至今日,他思索的新命题是——当 AI 已经能读懂和创造内容后,谁来承担组织的重任?

需要进一步了解?

免费在线咨询

新闻资讯

热门文章

相关文章

返回顶部