神通Transformer:深度学习领域的黑科技
2023-06-07
中国信息技术教育 2023年11期

主持人:
杨 磊 天津市第五中学
嘉 宾:
邱元阳 河南省安阳县职业中专
刘宗凡 广东省四会市四会中学
金 琦 浙江师范大学附属中学
倪俊杰 浙江省桐乡市凤鸣高中
应用沙龙
编者按:大型神经网络模型具备庞大的参数数量和计算量,被称为大模型,可解决自然语言处理、图像识别和语音识别等各类任务。训练大模型通常需要高性能计算设备和大规模数据集。由于Transformer可以处理大规模文本数据并构建更复杂的语言模型,因此它被广泛应用于大模型中。本期我们将继续介绍Transformer在深度学习领域中的应用。
模型、大模型与超大模型
杨磊:随着技术的不断发展和迭代,越来越多的大模型和超大模型被应用于各种领域,并取得了显著的成果。那么,如何界定模型、大模型和超大模型?
刘宗凡:模型是机器学习的核心概念,是从数据中映射出规律和模式的函数,它的本质是对现实世界中数据和规律的描述和抽象。机器学习是一种人工智能技术,其目的是通过计算机算法从现有数据中学习和发现应用模式,以便预测或做出决策。在机器学习中,模型是一个重要的概念,因为其扮演了学习和预测的核心角色。简而言之,模型就是从给定数据的输入中预测出对应输出的函数,其核心任务是利用给定的数据集训练模型并调节其参数,使其能够更好地拟合数据进行预测。模型的本质是对真实世界中的数据和规律进行抽象和描述,对现实世界的复杂性进行简化。……
登录APP查看全文
