目录

  • 1 信息与信息技术
    • 1.1 探索信息的真谛
    • 1.2 信息的度量
    • 1.3 信息技术
    • 1.4 计算机的信息表示与编码
    • 1.5 第一单元测验与练习
  • 2 计算与计算机系统
    • 2.1 探索计算之源
    • 2.2 从历史走向未来-计算机的发展史
    • 2.3 微型计算机系统
    • 2.4 外部存储设备
    • 2.5 输入输出子系统
    • 2.6 第二单元测验与练习
  • 3 软件定义的时代
    • 3.1 软件的性质及发展史
    • 3.2 操作系统
    • 3.3 应用软件
    • 3.4 第三单元测验与练习
  • 4 媒体信息的智能处理
    • 4.1 “媒体”的概念
    • 4.2 中文信息处理
    • 4.3 音频信号处理
    • 4.4 数字图像处理
    • 4.5 视频信息处理
    • 4.6 计算机图形处理技术
    • 4.7 新一代的人机交互技术
    • 4.8 第四单元测验与练习
  • 5 数据科学
    • 5.1 数据科学与Python
    • 5.2 数据库技术
    • 5.3 第五单元测验与练习
  • 6 算法、程序与问题求解方法
    • 6.1 问题解决与过程
    • 6.2 问题求解方法
    • 6.3 算法
    • 6.4 程序设计与过程
    • 6.5 第六单元测验与练习
  • 7 计算机通信与网络技术
    • 7.1 缩短世界的距离—通信与网络技术的历史回顾
    • 7.2 数据通信的基本原理
    • 7.3 计算机网络
    • 7.4 Internet基础
    • 7.5 Internet宽带接入方式
    • 7.6 第七单元测验与练习
  • 8 “互联网+”时代
    • 8.1 “互联网+”行动计划
    • 8.2 物联网
    • 8.3 云计算
    • 8.4 大数据:预测未来
    • 8.5 第八单元测验与练习
  • 9 信息安全与数据加密
    • 9.1 信息安全的基本内涵
    • 9.2 信息安全与数据加密
    • 9.3 数字签名
    • 9.4 第九单元测验与练习
  • 10 人工智能与应用
    • 10.1 人工智能概述
    • 10.2 人工智能主要的核心技术
    • 10.3 人工智能应用与国内知名生成式AI产品使用
    • 10.4 神经网络的一些基本知识
    • 10.5 卷积神经网络的层结构
  • 11 Office应用
    • 11.1 Office操作实践讲解
  • 12 问卷调查
    • 12.1 问卷调查
人工智能主要的核心技术

§10.2 人工智能主要的核心技术

一、人工智能主要核心技术

人工智能(AI)的核心技术及其应用涵盖了多个领域,这些技术共同构成了实现智能行为的基础,这些技术不仅单独存在,还常常结合在一起使用,形成复杂的AI系统。随着AI的发展,新技术和应用将会不断涌现,现有的技术也会持续进化,变得更加高效和多功能,以下是一些主要的人工智能技术:

1、机器学习(Machine Learning)

     让计算机系统通过大量数据学习,自动发现数据中的规律和模式,自动改进算法和模型,并据此做出预测或决策。

     监督学习:通过已有的输入数据和对应的输出结果来训练模型,让模型学习输入和输出之间的映射关系。应用场景:图像分类、语音识别、文本分类等。例如,在手写数字识别中,通过大量的手写数字图像及其对应的数字标签来训练模型,使其能够准确识别新的手写数字图像。

无监督学习:让计算机在没有明确输出结果的情况下,自动从数据中发现潜在的结构和模式。应用场景:数据聚类、异常检测、降维等。例如,在客户细分中,可以使用无监督学习算法将客户数据分成不同的群组,以便企业更好地了解客户行为和需求。

强化学习:通过智能体与环境的交互,让智能体学习如何在不同的状态下采取最优的行动,以获得最大的累积奖励。应用场景:机器人控制、游戏、自动驾驶等。例如,在围棋游戏中,人工智能程序通过与自己对弈不断学习,提高棋艺,最终战胜了人类顶尖棋手。

典型应用:推荐系统、金融风险评估、个性化广告、自动化交易系统、信用评分、欺诈检测、预测分析、搜索引擎排名等。

2、深度学习(Deep Learning)

机器学习的一个分支,它利用深度神经网络来模拟人脑的信息处理方式,学习数据的特征表示,特别擅长处理复杂的数据模式,如图像、声音和文本


神经网络结构:由多个神经元组成的层次结构,通过对输入数据进行一系列的线性和非线性变换,提取数据的特征并进行预测,模仿人脑神经元的网络,用于处理复杂的数据模式

常见结构:

卷积神经网络(ConvolutionalNeural Networks, CNNs):特别适用于图像识别和处理。

循环神经网络(RecurrentNeural Networks, RNNs):适用于处理序列数据,如时间序列分析和自然语言处理。

生成对抗网络(GenerativeAdversarial Networks, GANs):通过生成器和判别器的对抗训练生成新的数据实例。

长短期记忆网络(LSTM):一种特殊的循环神经网络,旨在解决传统 RNN 在处理长序列数据时遇到的梯度消失问题。LSTM能够有效地捕捉长期依赖关系,使其在自然语言处理、语音识别、时间序列预测等领域表现出色。

例如,CNN 擅长处理图像数据,RNN 和 LSTM 则适用于处理序列数据,如语音和文本。

训练方法

反向传播算法:通过计算模型输出与实际值之间的误差,然后将误差反向传播到网络中,调整网络的权重和偏置,以减小误差。

优化算法:如随机梯度下降(SGD)、Adam 等,用于加速模型的训练过程和提高训练效果。

典型应用

计算机视觉:图像识别、目标检测、图像分割等。例如,人脸识别技术可以在安防、金融等领域实现身份验证。

自然语言处理:机器翻译、语音识别、文本生成等。例如,智能客服可以通过理解用户的问题并给出准确的回答,提高客户服务效率。

游戏AI、药物发现等。

3、自然语言处理(Natural LanguageProcessing, NLP)

  使计算机能够理解、解释、处理和生成人类语言,结合了统计学、语言学和机器学习等领域的知识。

语言理解

   词法分析:对文本进行分词、词性标注等操作,以便更好地理解文本的结构和含义。

   句法分析:分析句子的语法结构,确定句子中各个词语之间的关系。

   语义分析:理解文本的语义内容,包括词义消歧、语义角色标注等。

语言生成

   文本生成:根据给定的主题或提示,生成自然语言文本。例如,新闻自动生成、诗歌创作等。

   对话生成:构建智能对话系统,能够与用户进行自然流畅的对话。例如,智能客服、聊天机器人等。

机器翻译

   基于规则的翻译:通过制定翻译规则和词典,将一种语言翻译成另一种语言。

   统计机器翻译:利用大量的双语语料库,统计语言之间的翻译概率,进行翻译。

   神经机器翻译:利用深度学习技术,构建端到端的翻译模型,直接将一种语言翻译成另一种语言。

    典型应用广泛应用于聊天机器人、智能客服、内容摘要、文本挖掘、语音助手、情感分析和语言翻译等。 

4、计算机视觉(Computer Vision)

  使计算机能够理解和处理图像和视频中的内容,这涉及到图像处理、特征提取以及图像识别等方面的知识。

图像识别:

        目标检测:识别图像中的物体,并确定其位置和类别。

        图像分类:将图像分为不同的类别,如动物、植物、风景等。

图像分割:

       语义分割:将图像中的每个像素分配到不同的类别中,以便更好地理解图像的内容。

        实例分割:不仅要区分不同的类别,还要区分同一类别的不同实例。

视频分析:

        行为识别:识别视频中的人物行为,如走路、跑步、跳跃等。

        视频跟踪:跟踪视频中的特定目标,如人物、车辆等。

   典型应用图像识别、目标跟踪、三维重建、医疗影像分析、自动驾驶汽车、物体检测、场景理解、安全监控、无人机、娱乐(如增强现实AR/虚拟现实VR体验)、工业质量控制等。

5语音处理(Speech Processing

   对人类语音信号进行采集、分析、理解和生成的一系列技术。它广泛应用于通信、计算机科学、人工智能、声学等多个领域。语音识别让计算机能够听懂人类的语音指令,语音合成则可以将文本转换为自然流畅的语音。

语音识别

       自动且准确地将人类语音转换为文本。它通过使用一些与自然语言处理相同的技术,如声学模型,来实现语音信号向文本或命令的转换。

语音合成

  将文本转换为自然流畅的语音,使计算机能够像人类一样说话。

典型应用:医疗听写、语音书写、电脑系统声控、电话客服、智能语音助手、有声读物、语音导航等。

6、机器人技术(Robotics)

   它涉及能够自动执行任务机器人的设计、制造、控制和应用,集成了感知、规划、控制等技术,使机器人能够在各种环境中执行任务。

机器人感知:

         传感器技术:利用各种传感器,如摄像头、激光雷达、超声波传感器等,获取机器人周围环境的信息。

         环境感知:通过对传感器数据的处理和分析,理解机器人所处的环境,包括物体的位置、形状、颜色等。

机器人运动控制:

         运动规划:根据任务需求和环境信息,规划机器人的运动路径和动作序列。

         运动控制:控制机器人的关节运动,使其按照规划的路径和动作执行任务。

人机交互:

         语音交互:通过语音识别和语音合成技术,实现人与机器人的自然语言交互。

         手势交互:通过识别用户的手势动作,实现人与机器人的交互。

         视觉交互:通过识别用户的面部表情、眼神等信息,实现人与机器人的交互。

    典型应用如自动驾驶、工业机器人、服务机器人、医疗手术机器人和探索机器人等。 

7、知识表示、推理和图谱(Knowledge Representation、Reasoning、Knowledge Graph)

   它们在人工智能领域中密切相关,它们共同构成了智能系统处理和理解知识的基础。知识表示与推理关注的是如何将知识以计算机能够理解和处理的形式进行表示,并利用这些知识进行推理和决策。而知识图谱则是一种具体的数据结构,用于存储和组织知识,它通过图形化的方式表示实体及其之间的关系。

  知识表示方法:通过从各种数据源中抽取知识,并以结构化的方式表示出来

     语义网络:用节点和边来表示概念和关系,便于进行知识的查询和推理。

     本体论:对特定领域的概念、关系和规则进行明确的定义和描述,为知识共享和重用提供基础。

     规则表示:用 if-then 规则来表示知识,便于进行逻辑推理。

  推理方法:基于知识图谱中的已有知识,推导出新的知识或结论。

      演绎推理:从一般到特殊的推理,根据已知的规则和事实推出新的结论。

      归纳推理:从特殊到一般的推理,通过观察大量的实例总结出一般性的规律。

      基于案例的推理:根据过去的经验和案例来解决新的问题。

   知识图谱一种结构化的知识表示,通过图数据结构来表示实体(如人、地点和概念)及其之间的关系。知识图谱由实体、关系和属性组成以图的形式的三元组构成,旨在提供一种更接近人类认知世界的知识表示方式,为人工智能提供丰富的背景知识和推理能力。

   典型应用智能问答、推荐系统、智能决策、故障诊断、搜索引擎优化、企业知识管理等。 

8、数据挖掘(Data Mining)

   数据挖掘是从大量的、不完全的、有噪声的、模糊的、随机的实际应用数据中,通过综合运用统计学、机器学习、数据库技术等多种方法和工具,自动地发现提取隐藏在其中但又有潜在价值的信息关系、模式、关系、趋势和知识的过程。

  数据挖掘的目标:

  发现未知模式:在数据中寻找那些之前未曾被发现的模式和关系。例如,在电商销售数据中,可能会发现某些商品在特定季节或特定地区的销售模式,这种模式可能是商家之前没有意识到的。

  预测未来趋势:利用历史数据建立模型,对未来的情况进行预测。比如,根据股票市场的历史数据预测未来股票价格的走势,或者根据用户的历史购买行为预测其未来可能购买的商品。

  支持决策制定:为企业或组织的决策提供数据支持。通过分析数据,发现市场机会、风险因素等,帮助决策者做出更明智的决策。例如,通过分析客户反馈数据,企业可以决定是否要改进产品或服务。

  数据挖掘的主要方法

   分类:根据已知类别的数据建立分类模型,对新的数据进行分类。例如,将电子邮件分为垃圾邮件和正常邮件,将客户分为高价值客户和低价值客户等。

   聚类:将数据对象划分为不同的组或簇,使得同一簇中的对象具有较高的相似性,而不同簇中的对象具有较大的差异性。比如,对客户进行聚类分析,可以发现不同类型的客户群体,以便企业制定针对性的营销策略。

   关联规则挖掘:发现数据中不同项之间的关联关系。例如,在超市销售数据中,发现购买面包的顾客很可能也会购买牛奶,这种关联关系可以帮助商家进行商品陈列和促销策略的制定。

   回归分析:建立变量之间的数学关系模型,用于预测连续数值型变量。例如,根据房屋的面积、位置、装修等因素预测房屋的价格。

  数据挖掘与生成式 AI的关系

  数据挖掘为生成式 AI 提供了基础的数据支持。生成式 AI 需要大量的数据来进行训练,以学习数据中的模式和规律。数据挖掘技术用于从海量的数据中抽取、转换、分析和处理信息,提取出有价值的数据供生成式 AI 模型进行学习。通过数据挖掘获取到的多样化、高质量的数据,能够帮助生成式 AI 模型更好地理解各种领域的知识和特征,从而生成更丰富、更准确的内容。例如,在图像生成领域,通过数据挖掘收集大量的图像数据用于模型训练;在文本生成领域,挖掘各种文本数据来提升模型对语言的理解和生成能力。

   典型应用

   商业领域:帮助企业进行市场分析、客户关系管理、销售预测等。例如,通过分析客户的购买历史和行为数据,企业可以进行精准营销,推荐个性化的商品,提高客户满意度和忠诚度。

   金融领域:用于风险评估、信用评级、欺诈检测等。例如,银行可以通过分析客户的财务数据和交易记录,评估客户的信用风险,防范欺诈行为。

   医疗领域:辅助疾病诊断、治疗方案推荐、医疗资源管理、预测疾病风险和治疗效果等。例如,通过分析电子病历数据和医学影像数据,医生可以发现疾病的潜在模式和风险因素,制定更有效的治疗方案。

   科学研究领域:在天文学、生物学、物理学等领域,数据挖掘可以帮助科学家从大量的实验数据和观测数据中发现新的规律和现象,推动科学研究的进展。

制造业:通过分析客户反馈和生产数据,改进产品设计和生产流程。

网络安全:通过分析网络流量和用户行为,检测潜在的安全威胁。 

9、模式识别(PatternRecognition)

   涉及研究和开发用于感知、分类和理解来自物理世界的信号(包括图像、声音、生物信号或者其他类型的数据等)的算法和技术,涵盖了计算机视觉、图像处理、语音识别、自然语言理解等多个领域

   核心技术:统计模式识别、生物特征识别(如指纹、虹膜扫描)、手写识别、条形码/二维码识别。

   应用:身份验证、安全系统(如面部识别)、支付系统、医学影像、生物信息学、医疗诊断、手写识别、金融领域的欺诈检测等。

10. 智能控制(Intelligent Control)

   它利用计算机科学、人工智能、传感器技术、系统工程和其他相关领域的知识,实现对复杂系统的自动控制和管理。智能控制的核心在于能够适应环境的变化,自主学习和优化决策,以实现高效、灵活和可靠的控制效果。

   核心技术:自适应控制、模糊逻辑、遗传算法、神经网络强化学习、专家系统、多智能体。

  应用:智能交通系统、无人机、工业自动化、机器人技术、智能家居、能源管理、农业自动灌溉、施肥等。


二、人工智能各核心技术之间的关系

人工智能的各核心技术之间存在着紧密的联系和相互作用,主要关系如下:

1.  机器学习与深度学习

    • 包含关系:深度学习是机器学习的一个重要分支和子集。机器学习是人工智能的一个核心领域,旨在让计算机从数据中学习并自动改进。深度学习则是在传统机器学习的基础上发展而来,它使用深度神经网络这种特殊的模型结构,能够自动学习数据中的复杂模式和特征。  

    • 基础与发展:机器学习为深度学习提供了理论基础和方法框架。早期的机器学习算法如决策树、支持向量机等为深度学习的发展奠定了基础,而深度学习在处理大规模数据和复杂任务上的出色表现,进一步推动了机器学习的发展,成为当前人工智能领域的重要研究方向。

2.  机器学习与自然语言处理、计算机视觉等应用领域技术 

    • 支撑关系:机器学习是自然语言处理和计算机视觉等技术的基础支撑。在自然语言处理中,机器学习算法用于文本分类、情感分析、机器翻译、问答系统等任务。例如,通过大量的文本数据训练机器学习模型,使其能够理解文本的语义、语法等信息,从而实现准确的翻译或回答问题。在计算机视觉中,机器学习算法用于图像识别、目标检测、图像分割等任务。例如,使用深度学习中的卷积神经网络对大量的图像数据进行训练,让计算机能够识别图像中的物体、场景等信息。  

    • 反馈优化:自然语言处理和计算机视觉等应用领域的发展也为机器学习提供了更多的数据和应用场景,促进了机器学习算法的不断改进和优化。例如,随着计算机视觉技术在安防、医疗等领域的应用,产生了大量的图像数据,这些数据可以用于训练更强大的机器学习模型,提高计算机视觉的准确性和效率。

3.  自然语言处理与计算机视觉  

    • 多模态融合:自然语言处理和计算机视觉在多模态人工智能系统中相互融合。多模态系统能够同时处理文本、图像、语音等多种模态的数据,实现更全面的理解和分析。例如,在智能助手或机器人中,结合计算机视觉对场景的感知和自然语言处理对用户指令的理解,可以实现更智能的交互和决策。  

    • 信息互补:自然语言处理和计算机视觉可以相互提供信息和支持。计算机视觉可以为自然语言处理提供图像相关的信息,帮助理解文本中涉及的视觉概念;自然语言处理可以为计算机视觉提供文本描述和语义信息,辅助图像的理解和分析。例如,在图像标注任务中,利用自然语言处理技术对图像的文本描述进行分析,可以提高图像标注的准确性。

4.  知识图谱与其他技术  

    • 知识基础:知识图谱为其他人工智能技术提供了丰富的知识基础和语义理解能力。知识图谱能够帮助机器学习、自然语言处理、计算机视觉等技术更好地理解数据的语义和背景知识。例如,在自然语言处理中,知识图谱可以用于语义理解、问答系统等,帮助计算机更准确地理解文本的含义并回答问题。  

    • 相互促进:其他技术的发展也有助于知识图谱的构建和完善。例如,机器学习算法可以用于从大量的数据中自动抽取和构建知识图谱;计算机视觉技术可以用于识别图像中的实体和关系,为知识图谱的构建提供信息。同时,知识图谱的不断完善也为其他技术的应用提供了更准确和全面的知识支持,促进了这些技术的发展。

5.  数据挖掘与其他技术  

    • 数据支持:数据挖掘为其他人工智能技术提供了数据处理和分析的手段。通过数据挖掘技术,可以从大量的数据中提取有价值的信息和模式,为机器学习、自然语言处理、计算机视觉等技术提供高质量的数据支持。例如,在机器学习的训练过程中,需要大量的标注数据,数据挖掘可以帮助从原始数据中筛选和标注出有用的数据,提高机器学习模型的训练效果。  

    • 应用协同:数据挖掘与其他技术在应用中相互协同。例如,在智能推荐系统中,数据挖掘技术用于分析用户的行为数据,挖掘用户的兴趣和偏好,然后结合自然语言处理技术对商品的文本描述进行分析,最后利用机器学习算法为用户提供个性化的推荐。

 这些技术之间的关系可以概括为:

    ·  互补性:不同的AI技术相互补充,共同解决复杂问题。例如,深度学习可以提供计算机视觉所需的特征提取能力,而机器学习则可以用于模式识别和分类。

    ·  集成:在许多应用中,需要将多种技术集成到一个系统中。例如,一个智能助手可能需要NLP来理解语言,机器学习来学习用户偏好,以及知识表示与推理来提供有用的回答。

    ·   层次性:一些技术建立在其他技术之上。例如,深度学习是机器学习的一种方法,而强化学习则是机器学习的一个应用领域。

    ·   协同:不同的AI技术可以协同工作,以提高整体系统的性能和智能。例如,计算机视觉和NLP可以结合使用,使机器人能够理解和响应视觉和语言指令。

随着AI技术的不断发展,这些核心技术之间的关系也在不断演变,新的集成方法和应用不断出现。


 

三、生成式 AI 使用了哪些AI主要核心技术

深度学习:深度学习是生成式 AI 背后的关键实现技术。它是机器学习的重要优化手段,而机器学习又是人工智能领域的重要落地实现方式。生成式 AI 中的神经网络,如卷积神经网络(CNN)和循环神经网络(RNN)等复杂结构,是基于深度学习的原理构建的。通过对大量数据的学习,这些神经网络能够自动提取数据中的特征和模式,从而实现生成新的内容,比如在图像生成中学习图像的特征,在文本生成中学习语言的模式和语义信息。

自然语言处理:自然语言处理技术在生成式 AI 中起着重要作用,尤其是在涉及文本生成的任务中。生成式 AI 要生成高质量的文本内容,需要依赖自然语言处理的技术来理解和处理人类语言的语法、语义、语境等。例如,通过词法分析、句法分析、语义分析等技术来理解输入的文本提示,并生成符合语言逻辑和语义表达的回复或新的文本内容。像 ChatGPT 等生成式 AI,在训练过程中大量运用了自然语言处理技术,以提高生成文本的准确性、连贯性和可读性。

数据挖掘:数据挖掘为生成式 AI 提供了基础的数据支持。生成式 AI 需要大量的数据来进行训练,以学习数据中的模式和规律。数据挖掘技术用于从海量的数据中抽取、转换、分析和处理信息,提取出有价值的数据供生成式 AI 模型进行学习。通过数据挖掘获取到的多样化、高质量的数据,能够帮助生成式 AI 模型更好地理解各种领域的知识和特征,从而生成更丰富、更准确的内容。例如,在图像生成领域,通过数据挖掘收集大量的图像数据用于模型训练;在文本生成领域,挖掘各种文本数据来提升模型对语言的理解和生成能力。

神经网络:神经网络是生成式 AI 常用的技术基础。如变分自动编码器(VAE)和生成对抗网络(GAN)等都是常用的生成模型,它们通过训练两个竞争性网络(生成器和判别器)来生成逼真的数据。Transformer 架构也是生成式 AI 中重要的架构,特别擅长处理序列数据,如文本。像 GPT 系列模型就是基于 Transformer 架构的,它能够有效地捕捉文本中的长距离依赖关系,从而生成高质量的文本内容。

 

四、机器学习

让计算机系统通过大量已知的数据进行分析和自动化推理,自动发现数据中的规律和模式,自动改进算法和模型,并据此模型对新的情境做出模式识别、预测和决策。

1、机器学习的工作原理

机器学习是用大量的数据来“训练”,通过各种算法从数据中学习如何完成任务。机器学习是一种新的编程模式,机器学习强调“学习”而不是程序本身。

机器学习通过分析大量数据来进行学习,研究的主要内容是如何通过数据集产生模型。因此机器学习本质上研究的是算法,当面对新的数据时,模型会给人们提供一定的判断,即是数据预测(不需要特定的代码)。

训练过程:


2、机器学习中使用的算法类别:

监督学习:通过已有带有标签的训练数据来训练模型,让模型学习输入和输出之间的映射关系,然后使用该模型对新的未标记数据进行预测。

其数据具备特征(features)与预测目标(label),label是指给对象一个标签,通过算法训练并建立模型(图 10-7)。当有新数据时,我们就可以使用模型进行预测。如不需要通过编程来识别猫或人脸,而是通过使用图片来进行训练,从而归纳和识别特定的目标。学生有答案的刷题场景正是监督学习的真实写照。

监督学习可以高效地让模型获得训练样本中蕴含的规律,但样本的标记成本其实很高。标记往往通过人工完成,尽管很多标记工作本身并不复杂,但在样本量庞大的时候仍然十分可怕。 

应用场景:图像分类、语音识别、文本分类等。例如,在手写数字识别中,通过大量的手写数字图像及其对应的数字标签来训练模型,使其能够准确识别新的手写数字图像。

无监督学习

从未标记的数据中发现隐藏的模式和结构,并将其特征分成各种类别,有时也称"聚类问题"。与有监督学习不同,无监督学习不需要依赖预先标记的数据进行训练,而是通过算法自动从数据本身提取信息和模式。常被用于数据挖掘,用于在大量无标签数据中发现些什么。它的训练数据是无标签的,训练目标是能对观察值进行分类或者区分等。

正如我们曾经做过不少没有参考答案的习题,互联网上的数据绝大部分也是没有标记的。例如无监督学习应该能在不给任何额外提示的情况下,仅依据所有“猫”的图片的特征,将“猫”的图片从大量的各种各样的图片中将区分出来。


应用场景:数据聚类、异常检测、市场细分、社交网络分析、图像去噪、基因表达分析等领域。例如,在客户细分中,可以使用无监督学习算法将客户数据分成不同的群组,以便企业更好地了解客户行为和需求。 

强化学习:又称再励学习、评价学习或增强学习,是机器学习的范式和方法论之一,主要研究智能体在环境交互过程中如何通过不断试错来学习并优化其行动策略,以最大化所获得的奖励。它是一种学习如何从状态映射到行为以使得获取的奖励最大的学习机制。一个智能体需要不断地在环境中进行实验,通过环境给予的反馈(奖励)来不断优化状态-行为的对应关系。这一过程与心理学中的行为主义理论有一定的相似性,即根据行为效果(环境对行为的反馈——奖励或惩罚)来调整自己的行为。

强化学习会在没有任何标签的情况下,通过先尝试做出一些行为得到一个结果,通过这个结果是对还是错的反馈,调整之前的行为,就这样不断的调整,算法能够学习到在什么样的情况下选择什么样的行为可以得到最好的结果。

例如你有一只还没有训练好的小狗,每当它把屋子弄乱后,就减少美味食物的数量(惩罚),每次表现不错时,就加倍美味食物的数量(奖励),那么小狗最终会学到一个知识,就是把客厅弄乱是不好的行为。

强化学习非常适用于需要机器根据外界环境进行自主决策的场景,比如无人驾驶、机器人等等,据说AlphaGo在训练时也应用了强化学习。

应用场景:机器人控制、游戏、自动驾驶、资源管理、金融交易、医疗诊断和治疗等。例如,在围棋游戏中,人工智能程序通过与自己对弈不断学习,提高棋艺,最终战胜了人类顶尖棋手。

 3、学习的区别

    有监督学习:就好比你在学习的时候,有一个导师在旁边指点,他知道怎么是对的怎么是错的,但在很多实际问题中,例如国际象棋,围棋,这种有成千上万种组合方式的情况,不可能有一个导师知道所有可能的结果。而这时,强化学习会在没有任何标签的情况下,通过先尝试做出一些行为得到一个结果,通过这个结果是对还是错的反馈,调整之前的行为,就这样不断的调整,算法能够学习到在什么样的情况下选择什么样的行为可以得到最好的结果。

   无监督学习:不是学习输入到输出的映射,而是模式。例如在向用户推荐新闻文章的任务中,无监督学习会找到用户先前已经阅读过类似的文章并向他们推荐其一。强化学习将通过向用户先推荐少量的新闻,并不断获得来自用户的反馈,最后构建用户可能会喜欢的文章的“知识图”。

 


五、深度学习

它是机器学习研究中的一个新的领域,其动机在于建立、模拟人脑进行分析学习的神经网络,它通过模拟人脑的工作方式,使计算机能够从大量数据中自动学习和提取有用的特征。它模仿人脑的机制来解释数据,例如图像,声音和文本。

深度学习是无监督学习的一种。其概念源于人工神经网络的研究。含多隐层的多层感知器就是一种深度学习结构。深度学习通过组合低层特征形成更加抽象的高层表示属性类别或特征,以发现数据的分布式特征表示。

 1、向人脑学习的“深度学习”

人类智能最重要的部分是大脑,大脑虽然复杂,它的组成单元却是相对简单的,大脑皮层以及整个神经系统是由神经元细胞组成的。

1981年的诺贝尔生理与医学奖,分发给了 RogerW. Sperry,David H. Hubel,TorstenN. Wiesel,他们的的主要贡献是,发现了人的视觉系统的信息处理是分级。

人类视觉信息分级处理

这个生理学的发现,促成了计算机人工智能,计算机专家仿照人类大脑由低层到高层逐层迭代、抽象的视觉信息处理机理,建立深度网络模型。深度网络每层代表可视皮层的区域,深度网络每层上的节点代表可视皮层区域上的神经元,信息由左向右传播,其低层的输出为高层的输入,逐层迭代进行传播,从低层到高层的特征表示越来越抽象和概念化。

多级层次化的概念让计算机构建较简单的概念来学习复杂概念。可以模仿人类大脑的这个特点,构造多层的神经网络,较低层的识别初级的特征,若干底层特征组成更上一层特征,最终通过多个层级的组合,最终在顶层做出分类,用“简单模型”即可完成复杂的分类等学习任务。由此可以理解源于人工神经网络的研究通过这个有一定深度的多层次网络进行学习的方法就是深度学习(Deep Learning)概念的来历。 

2、“深度学习”有多深

“深度学习”中的“深度”指的并不是利用这种方法所获取的更深层次的理解, 而是指一系列连续的表示层. 数据模型中包含多少层, 这被称为模型的深度(depth) 。

深度学习网络结构是由输入层、 隐藏层和输出层组成,隐藏层可以有很多层,为什么要这样设计呢? 例如, 在图像识别中,第一个隐藏层学习到的是“边缘”的特征, 第二个隐藏层学习到的是由“边缘”组成的“形状” 特征, 第三个隐藏层学习到的是由“形状” 组成的“图案” 特征, 最后的隐藏层学习到的是由“图案”形成的“对象” 的特征等。

 



深度学习可以理解为传统神经网络的拓展,如图,深度学习采用了与神经网络相似的分层结构,只有相邻层的节点之间才有连接,而同一层以及跨层节点之间相互无连接,这样的结构带来的优点是对所有的问题都可以用同样的流程来解决。

深度学习中的神经网络可以包含任意数量的层,这取决于具体的应用、任务的复杂性以及设计者的选择。一般来说,神经网络的层数从几层到几百层甚至上千层不等。不同类型的神经网络,它们的层数差异很大。 

3、最受欢迎的深度学习算法:

卷积神经网络(CNN):适用于图像处理和目标检测,广泛应用于图像识别、物体检测和视频分析等领域。

循环神经网络(RNN):处理序列数据的专家,用于时间序列数据、语音识别和文本处理等。

长短期记忆网络(LSTM):解决RNN的长期依赖问题,用于文本摘要、语音识别等需要长期记忆的场景。

生成对抗网络(GAN):通过生成器和判别器两部分,生成类似于训练数据的新数据实例,应用于图像生成、数据增强等。

自编码器(AE):无监督学习模型,用于降维和特征学习,数据预处理和特征提取的重要工具。

深度信念网络(DBN):由多个受限玻尔兹曼机堆叠而成,用于特征学习和预训练。

Transformer:利用自注意力机制捕捉序列中的长距离依赖关系,自然语言处理任务中的卓越性能。

深度强化学习(DRL):结合深度学习和强化学习,通过与环境交互学习最优策略,应用于自动驾驶、游戏AI等。

这些算法不仅在学术界有深入的研究,也在工业界得到了广泛的应用,推动了人工智能领域的快速发展。

 


六、生成式人工智能与大模型

1、生成式人工智能(GenerativeAI)也称生成式AI

   生成式AI是一种利用机器学习模型和深度学习技术,通过学习大规模历史数据集生成全新的原创内容的新型人工智能技术。它能够基于算法、模型、规则生成文本、图片、声音、视频、代码等各种类型的内容。生成式人工智能在2022年底因Open AI公司ChatGPT发布而引起了公众广泛关注,并在教育和研究等多个行业引发颠覆性变革。2023年以来,以ChatGPT为代表的生成式人工智能成为全球科技热点,它不仅影响着人类的生活和生产方式,还为各种行业的创新和发展提供了新的工具和视角。

  工作原理

    • 数据收集:收集大量的文本、图像、音乐等数据作为模型训练的基础。这些数据来源广泛,如互联网网页、书籍、论文、图片库、音乐库等。数据的质量和多样性对生成式 AI 的性能至关重要。  

    • 模型训练:使用深度学习算法(如神经网络)对收集到的数据进行训练。在训练过程中,模型会学习数据中的模式、结构和规律。例如,在文本生成中,模型会学习词语的搭配、句子的结构和语义的理解;在图像生成中,模型会学习图像的特征、纹理和构图等。常用的神经网络架构包括卷积神经网络(CNN)用于处理图像数据、循环神经网络(RNN)和其变体长短期记忆网络(LSTM)用于处理序列数据(如文本),以及 Transformer 架构在自然语言处理中表现出色。  

    • 生成内容:通过输入一些初始条件或提示,模型根据在训练过程中学到的知识和模式生成新的内容。生成的内容基于模型对数据的理解和对概率的预测。例如,在文本生成中,输入一个主题或开头,模型会根据学习到的语言模式生成后续的文本;在图像生成中,输入描述性的文本,模型会生成符合文本描述的图像。

   应用领域:  

    • 文本生成:可以编写文章、新闻报道、故事、诗歌、代码等。例如,ChatGPT 等大型语言模型能够根据用户的提问生成详细的回答和文章,帮助用户快速获取信息和解决问题,在智能客服、内容创作、辅助写作等方面有广泛应用。  

    • 图像生成:能够根据文本描述或特定的要求生成逼真的图片。像 DALL-E、Stable Diffusion 等模型,可以根据输入的文本提示生成各种风格和主题的图像,为艺术创作、设计、广告等领域提供了新的创意工具。  

    • 音乐生成:创作新的音乐作品,模仿不同风格和艺术家的创作方式。生成式 AI 可以根据用户的喜好和需求生成特定风格的音乐,如古典、流行、摇滚等,为音乐创作和音乐产业带来了新的可能性。  

    • 视频生成:生成视频内容,如动画短片、影视特效等。虽然目前视频生成技术还在不断发展中,但已经能够生成一些简单的视频片段和动画,未来有望在视频制作、广告、娱乐等领域发挥重要作用。  

    • 对话系统:广泛应用于聊天机器人和虚拟助手中,生成自然的对话内容。通过理解用户的输入,生成合适的回复,为用户提供智能的交流和服务,应用于在线客服、智能助手、社交娱乐等场景。

    • 医疗保健:药物发现、个性化医疗、医疗成像改进等。  

    • 教育:个性化课程、课程设计、教学材料生成等。  

    • 游戏:程序性内容生成、玩家行为分析等。

优势、挑战与安全风险

   优势:

 提高效率:能够快速生成大量的内容,节省了人工创作的时间和精力。例如,在新闻报道中,生成式 AI 可以快速生成初稿,记者只需进行编辑和审核,大大提高了新闻生产的效率。

 激发创意:为创作者提供新的灵感和创意,帮助他们突破思维局限。生成式 AI 可以生成各种新颖的想法和概念,为艺术创作、设计、广告等领域带来新的创意方向。

 个性化服务:根据用户的需求和偏好生成个性化的内容,满足用户的个性化需求。例如,在音乐推荐和视频推荐中,生成式 AI 可以根据用户的历史记录和喜好生成个性化的推荐列表。

   挑战:

  准确性和可靠性:生成的内容可能存在错误、不准确或不恰当的情况。例如,在文本生成中,可能会出现语法错误、逻辑不通或与事实不符的内容;在图像生成中,可能会生成不符合常理或不真实的图像。

 伦理和法律问题:可能会引发伦理和法律方面的争议,如虚假信息的传播、知识产权的侵犯、隐私的泄露等。例如,生成式 AI 生成的虚假新闻可能会误导公众,侵犯他人的知识产权可能会引发法律纠纷。

       数据依赖和偏见:生成式 AI 的性能依赖于大量的数据,如果数据存在偏差或不完整,可能会导致生成的内容存在偏见。例如,在训练数据中如果存在性别、种族等方面的偏差,生成的内容可能会反映出这种偏差。

   安全风险

 恶意输出:生成式AI可能被恶意使用或滥用,生成虚假信息或误导性内容,对社会造成不良影响。

       版权侵犯:AI生成的内容可能侵犯版权,尤其是当它生成受版权保护的作品时。

       深度伪造:AI技术可以生成高度逼真的虚假视频和音频,用于欺诈等恶意目的。

 

2、大模型

也称 AI 大模型,是指使用大规模数据和强大的计算能力训练出来的 “大参数” 模型,具有大量参数和复杂计算结构的机器学习模型。这些模型通常由深度神经网络构建,拥有数十亿甚至数千亿个参数,能够处理海量数据并完成各种复杂的任务。2022年底 以OpenAI 公司推出GPT-3为代表的预训练大模型取得了巨大的成功,引发了大模型研究和应用的热潮,大模型在自然语言处理、计算机视觉、语音识别和推荐系统等领域取得广泛应用。

关于大模型的一些关键信息:

1.基本特点:

o  参数规模大:拥有百亿、千亿甚至万亿级别的参数。例如,OpenAI 公司的 GPT-3 拥有1750 亿模型参数量,而国内的一些大模型参数规模也在不断增长。参数数量越多,模型能够学习和表示的信息就越丰富,从而具备更强大的语言理解和生成能力。

o  训练数据规模大:需要大量的文本、图像、语音等数据进行训练,这些数据来源广泛,包括互联网网页、维基百科、书籍论文、问答网站等。通过对海量数据的学习,模型可以掌握各种语言表达方式、语义理解、视觉和知识信息。

o  算力消耗需求大:训练大模型需要强大的计算资源,包括高性能的 GPU服务器、分布式计算系统等。大规模的参数和数据需要大量的计算能力和存储资源来进行处理和训练,这也导致了大模型的训练成本较高。

2.训练过程:

o  预训练阶段:通过海量的训练数据预先喂给模型,构建基础语言模型,使其具有语言生成的能力。

o  有监督微调:使用少量高质量数据集合,对模型进行进一步调整,使其能够给出更贴合用户问题的答案。

o  奖励建模与强化学习:模拟人类评估的过程,对模型的回答进行打分反馈,让模型不断尝试改善得分策略,以提高回答表现。

o  语言模型训练:对经过上述步骤构建好的模型进行训练和不断优化,最终得到可用的大模型。

3.  应用领域:

o  自然语言处理(NLP):如GPT系列模型,在文本生成、摘要、翻译等任务中表现优异。

o  计算机视觉(CV):如ResNet、BERT等模型,在图像分类、目标检测、人脸识别等领域有广泛应用。

o 多模态学习:结合文本、图像、音频等多种数据类型,实现跨模态的信息检索和理解。

o  推荐系统:通过分析用户行为和偏好,提供精准的广告、内容和商品推荐

o  自动驾驶:用于路径规划、物体检测和行为预测。

o  医疗诊断:在医学影像分析、疾病预测和病历管理方面展现潜力。

o  金融分析:用于风险评估、欺诈检测和股票预测。

o  客户服务:通过智能客服系统实现自动回复和情感分析。

o  教育:包括智能辅导、作业批改和知识图谱。

o  内容创作:在新闻写作、剧本创作和音乐生成等方面大放异彩。   

4.  优势与挑战:

o  优势:具有高度的通用性和泛化能力,能够处理多种复杂任务,如文本生成、翻译、问答、推理等,并且在很多任务上能够达到较高的准确率和效率。

o  挑战:存在可靠性差、训练数据依赖、因果推理能力弱、搭建成本高等问题,同时也面临着如何寻找合适落地场景、解决数据隐私和安全等挑战

 

3、知名大模型

国外知名大模型:

1、ChatGPT:ChatGPT 是OpenAI 基于 GPT-3.5 研发的大规模对话式语言模型,ChatGPT 采用对话格式,目前已经做到流利回答问题、纠正自己的错误、挑战用户提出的不正确的前提并拒绝不正当的要求,且支持中文。2023/03/15 openAI 发布了多模态预训练大模型 GPT-4,并且同步升级了 ChatGPT。

2、Claude:Anthropic开发的一个大型语言模型,它在多个任务上展示了超越ChatGPT-4的能力,特别是在理解深层次语言模式和复杂推理方面。

3、Gemini:Google Research团队开发的一个大型语言模型,它在自然语言理解和生成方面具有强大的能力,通常用于研究和实验性项目。

4、Mistral:一个专注于生成式任务的AI模型,它通过学习大量数据来模拟和预测内容,常用于文本生成和图像生成等任务。

5、Llama (Hugging Face Space):Hugging Face公司推出的一个模型,它在自然语言处理任务中表现出色,如文本分类、问答和文本生成,适用于多种应用场景。

国内知名大模型:

1、云雀模型:字节跳动公司典型产品豆包是基于云雀模型开发的AI工具,提供聊天机器人、写作助手以及英语学习助手等功能,能够回答各种问题并进行对话,帮助人们获取信息,支持网页Web平台、iOS以及安卓平台。

‌2、文心一言‌:也称“Ernie”大模型,作为百度公司研发的生成式AI产品,文心一言具备强大的语言理解和生成能力,能够进行自然、流畅的对话,提供知识问答、文本创作、逻辑推理等多种功能。它还具备多领域知识增强的特点,广泛应用于客户服务、内容创作、教育等领域。

‌3、Kimi大模型:北京月之暗面科技有限公司(Moonshot AI)开发的大模型,它是一款面向普通用户的智能助手,专注于提供高效的信息查询和对话服务。Kimi的主要特点包括支持200万字超长无损长文本处理,能够理解和回应用户的问题,为用户提供深入的内容分析和总结。提供及时、准确的信息支持。Kimi还具备文件阅读能力,可以阅读和分析多种格式的文件,如TXT、PDF、Word文档、PPT幻灯片和Excel电子表格等,它还具备广泛的知识覆盖,能够处理包括科技、文化、历史、教育等多个领域的信息。它可以辅助用户进行学术研究、数据分析、编程、翻译和日常咨询等多种任务。

4、腾讯混元大模型:腾讯公司自主研发的大型语言模型,结合了腾讯在AI领域的多年积累和技术优势,具备强大的语言理解和生成能力,支持多轮对话、文本创作、知识问答等多种任务,并注重与腾讯生态系统的整合,广泛应用于社交、游戏、内容等多个领域。

‌5、通义千问大模型:阿里云推出的超大规模语言模型,具备多轮对话、文案创作、逻辑推理、多模态理解、多语言支持等功能,注重与实际应用场景的结合,致力于为用户提供高效、便捷的智能化服务。

6、星火认知大模型‌:科大讯飞推出的认知智能大模型,具备知识增强、检索增强和对话增强的技术特色,支持跨语言、跨领域的知识理解和推理,能够处理文本、语音、图像等多种形式的输入。

‌‌7、盘古大模型:是由华为云、循环智能和鹏城实验室联合开发的人工智能模型,由三个模型构成:盘古 NLP 大模型,盘古 CV 大模型,科学计算大模型,后续又发布了矿山、药物分子、气象、海浪等行业大模型

此外,国内还有非常多的大模型:智谱AI(GLM智谱清言)、中科院(紫东太初)、百川智能(百川大模型)、360智脑、商汤(商量)、MiniMax(ABAB大模型)、上海人工智能实验室(书生大模型)等大模型,这些模型在各自的应用领域内展现了强大的功能和广泛的应用前景,这些模型在功能和应用领域各有特色,能够满足不同的需求。‌‌

 

4、生成式AI与大模型的关系

   生成式AI(Generative AI)与大模型(Large Models)在人工智能领域中都是热门的概念,它们之间存在密切的联系,但也有明显的区别:

生成式AI:生成式AI是人工智能的一个分支,专注于使用机器学习模型来生成新的、原创的内容。这些内容可以包括文本、图像、音频、视频等。生成式AI的关键在于创造性地模仿或扩展人类的创造能力。它通常涉及以下技术:

      生成对抗网络(GANs):通过生成器和判别器的对抗训练来生成新的数据实例。

      变分自动编码器(VAEs):通过学习数据的潜在表示来生成新的数据点。

      自回归模型:如Transformer,通过预测序列中的下一个元素来生成文本或音乐。

大模型:大模型是指那些具有大量参数的机器学习模型,这些参数通常达到数十亿甚至数千亿。大模型通过在大规模数据集上进行预训练来学习复杂的特征和模式。它们在自然语言处理(NLP)领域尤其流行,能够理解和生成人类语言。大模型的例子包括:OpenAI的Chargpt,文心一言、混元、豆包等。

生成式AI与大模型区别:

       焦点:生成式AI更侧重于创造新的数据实例,而大模型更侧重于理解和生成语言。

        应用范围:生成式AI的应用范围更广,涵盖多种类型的生成技术和应用,能创建文本、图像、音乐、视频等各种类型的内容。例如,不仅有基于文本的生成式模型(如 ChatGPT 可生成文本),还有用于图像生成的模型(如 DALL-E 可生成图像)、音乐生成模型等,可用于创意领域(如艺术、设计、写作等)以及实用领域(如自动化文档生成、数据增强等)。大模型主要侧重于自然语言处理等特定领域的模型构建和应用,虽然也可以扩展到多模态,但目前主要以文本处理为核心。通常是指拥有庞大参数和复杂结构的深度学习模型,经过在大量文本数据上的训练,能够处理海量的数据和复杂的任务,可应用于自然语言处理、计算机视觉、语音识别等领域,但在实际应用中更多体现在自然语言处理相关任务上,如文本生成、问答、机器翻译等。

        技术实现:虽然生成式AI和大模型都使用深度学习技术,但它们在网络结构和训练方法上可能有所不同。

生成式AI与大模型关系

       相互依赖:生成式AI中的许多应用,特别是在文本生成方面,依赖于大模型的能力。大模型提供了生成式AI所需的底层技术。

       技术融合:在一些情况下,大模型本身就是生成式AI的一部分,例如,大型语言模型可以被视为生成式AI的一种实现。

       共同目标:两者都旨在通过机器学习技术提高自动化和智能化水平,增强人类的能力。

总的来说,生成式AI是一个更广泛的概念,涵盖了使用AI创造新内容的各种方法,而大模型是实现这些目标的一种技术手段,特别是在处理和生成自然语言方面。