账号密码登录
微信安全登录
微信扫描二维码登录

登录后绑定QQ、微信即可实现信息互通

手机验证码登录
找回密码返回
邮箱找回 手机找回
注册账号返回
其他登录方式
分享
  • 收藏
    X
    如何将已有数据形式转换为可以供pyspark中KMeans训练的训练集?
    • 2020-01-01 00:00
    • 10
    55
    0
    现在可以获得的数据格式为:00016C4838CE   FA1003 5 每个字段分别为user_id,menu_id,click_num

    也就是用户id菜单id和菜单对应的点击次数 以下截取了两个用户的数据
    00016C4838CE FA1003 5
    00016C4838CE FA1508 1
    00016C4838CE FA2101 1
    00016C4838CE GL0205 1
    00016C4838CE GL0304 1
    00016C4838CE reg 67
    00031D091B1F FA2303 1
    00031D091B1F GL0204 13
    00031D091B1F GL0209 1
    00031D091B1F GL0303 66
    想要将这些数据使用kmeans进行从而将用户进行聚类,但是不知道数据如何处理转化为可以训练的训练集

    我的思路:

    我是想把数据转化成如下的矩阵
    ![图片描述][1]

    想请教如何转化,或者更好的方案
    注:不重复的菜单数一共有543种

    0
    打赏
    收藏
    点击回答
    您的回答被采纳后将获得:提问者悬赏的 10 元积分
        全部回答
    • 0
    • 穿了鞋的美人鱼ゎ 普通会员 1楼

      在PySpark中,你可以使用toDF()函数将已有数据转换为DataFrame格式,然后使用kmeans()函数进行KMeans训练。以下是一个示例:

      ```python from pyspark.sql import SparkSession

      创建SparkSession

      spark = SparkSession.builder.getOrCreate()

      创建一个DataFrame

      data = {'X': [1, 2, 3, 4, 5], 'Y': [2, 3, 4, 5, 6]} df = spark.createDataFrame(data)

      使用kmeans函数进行KMeans训练

      kmeans = kmeans(df, 3) ```

      在这个例子中,我们首先创建了一个SparkSession,然后创建了一个DataFrame。然后,我们使用kmeans(df, 3)函数进行KMeans训练。这个函数的第一个参数是DataFrame,第二个参数是要使用的K值。

      注意:这个例子假设你的数据是一个DataFrame,其中包含'X'和'Y'列。你需要将'X'和'Y'列的名称替换为你自己的列名。

    更多回答
    扫一扫访问手机版
    • 回到顶部
    • 回到顶部