QRazy
值得讨论的问题
📄 文章 问题 / 💻 科技

不同的人工智能架构及其区别

Краткий пересказ от QRazy ИИ

  • 了解LLM——大型语言模型,它们预测文本并具有独特的能力。
  • 发现LCM——概念模型,提升对长链推理的理解。
  • 理解VLM——结合视觉和语言的模型及其在现实生活中的应用。
  • 认识MoE——一种通过只激活部分专家来有效利用资源的架构。
  • 探索LAM和SAM的潜力,它们超越了文本生成,并能够在数字世界中执行操作。

探索各种人工智能架构,了解它们的不同之处。发现关键的人工智能类型、它们的特点和应用领域,以便更深入地理解未来技术。

带古代符号的插图"
关于古代符号的问题

人工智能并不是一种特定的技术,而是一整套不同的 方法。近年来出现了众多架构,每一个都在以自己的方式解决问题并处理数据。

以下是今天在现代人工智能系统中最常讨论的主要模型类型。

LLM — 大型语言模型

LLM(大型语言模型) 是处理文本的模型, 将其分解为小部分,并逐步预测下一个 元素。

它们的强大之处在于能够在海量文本中找到规律,并生成连贯的回答、文本和推理。

最著名的例子是 GPT-4、Claude 3、Grok 和 Llama 3。这些模型 在数百TB的图书、网站和代码库文本上进行训练。 有趣的是,大型LLM常常表现出“突现能力”—— 这些能力在模型达到某个特定规模后突然出现(例如,解决数学问题或开玩笑的能力)。然而,它们 非常耗资源:训练一个顶级模型可能花费数千万美元,并消耗的能源相当于一个小城市。

LCM — 大型概念模型

LCM(大型概念模型) 是一种较新的方法,其中模型 不处理单个词,而是处理整体意义单元。

这种模型通过“概念”而不是逐步处理文本,使其能够更好地捕捉信息的整体意义和结构。

LCM试图克服经典LLM的主要缺点——在长推理链中“失去意义”。它们不仅用token来处理信息, 而是使用高层次的理念,使其在复杂的 规划、科学研究和长期对话中更具前景。这些模型 可以更好地理解因果关系,并在抽象主题上减少“幻觉”。

VLM — 结合视觉和语言的模型

VLM(视觉-语言模型) 结合了图像和文本的处理。

它们能够分析视觉信息并用语言描述它,同时 回答与图像相关的问题。

明亮的例子包括 GPT-4V、Claude-3-Opus、LLaVA、Qwen-VL 和 Gemini。这些 模型已在现实生活中使用:从帮助盲人(描述 周围世界)到自动分析医学图像和工厂的生产控制。奇妙的是,现代VLM不仅可以 描述图像,还可以理解表情包,读取图像上的文本,甚至对视频中的镜头顺序进行推理。

SLM — 小型语言模型

SLM(小型语言模型) 是语言模型的紧凑版本, 经过优化以便在资源有限的设备上运行。

它们更快、更轻,但通常在质量和深度 推理方面不如大型模型。

例子:Microsoft Phi-3(38亿参数)、Google Gemma 2B/7BApple OpenELM。这些模型可以在智能手机或笔记本电脑上 离线运行,这对于隐私和网络连接差的地区至关重要。 尽管它们较小,但通过先进的蒸馏和量化技术,它们在质量上有时令人惊讶地接近大量更大的 模型。

MoE — 专家混合

MoE(专家混合) 是一种架构,其中模型由 多个专业子系统组成。

在每个请求中,仅激活一部分这些“专家”,使得 系统更高效、更具可扩展性。

经典示例是 Mixtral 8x7BGrok-1 (314B)。与其同时使用3140亿参数, MoE仅激活20-30%。这大大节约了能源,使得打造 真正巨大的模型成为可能。MoE现在被认为是进一步 扩展人工智能的主要途径之一。

MLM — 掩蔽语言模型

MLM(掩蔽语言模型) 训练于填补缺失文本的任务。

它们从两侧分析上下文,有助于更好地理解短语的意义。

最著名的代表是 BERT 来自Google 及其后代 (RoBERTa、DistilBERT)。正是MLM方法彻底改变了谷歌搜索、 推荐系统和文本情感分析。这些模型在理解方面特别强(分类、命名实体识别),而非 生成,因此通常作为更复杂 系统内部的“大脑”使用。

LAM — 动作模型

LAM(大型动作模型) 是超越文本生成的模型,可以在数字环境中执行动作。

它们能够解释请求并将其转化为一系列操作。

LAM 是聊天机器人之后的下一个步骤:可以 管理浏览器、填写表单、使用应用程序,甚至 操纵机器人。示例包括Adept、Anthropic Computer Use和 各种Agent框架。它们为真正的数字 助手开辟了道路,不仅仅是提供建议,而是实际替代人类完成工作。

SAM — 图像分割模型

SAM(Segment Anything Models) 用于在对象级别上处理图像。

它们能够以高精度识别和分离图像中的任何元素。

Segment Anything模型(Meta, 2023)成为真正的突破:它可以 仅根据一个点或文本描述对照片或视频中的几乎任何对象进行分割。它被用于图像编辑器、医学(分割 肿瘤)、自动驾驶、AR/VR和生成工具(例如, 在Midjourney和Runway中进行精确编辑)。这是当前最通用的 计算机视觉模型之一。

不同的人工智能架构并非偶然存在——每一个都在解决特定类型的问题。有些地方更注重速度,有些地方更重视图像理解,还有些地方则是执行行动或处理大量文本的能力。

这里是最后的视频

现代人工智能 正在向整个专门解决方案的方向发展,而不是朝着单一的通用模型前进。

现代人工智能并不是在朝着单一的 通用模型发展,而是在朝着整套专门解决方案及其 组合(例如,一个代理中的MoE + VLM + LAM)发展。在未来几年中,我们 很可能会看到不同架构的“交响乐”,其中每个部分都专注于自己擅长的领域。

🔒 註冊後即可免費取得完整答案

Обсуждение закрыто

Видно, что спор идет. Быстрый вход — и ответы откроются сразу.

Загрузка...
提出尖锐问题

这里可以讨论争议话题。

比较不同观点。

比较不同观点。

优质评论会上升。

优质评论会上升。

顾问 在线