spark dataframe 怎么去除第一行数据

发布网友 发布时间:2022-04-25 06:40

我来回答

1个回答

热心网友 时间:2022-04-11 04:16

然后我们进入spark-shell,控制台的提示说明Spark为我们创建了一个叫sqlContext的上下文,注意,它是DataFrame的起点。
接下来我们希望把本地的JSON文件转化为DataFrame:
scala> val df = sqlContext.jsonFile("/path/to/your/jsonfile")df: org.apache.spark.sql.DataFrame = [age: bigint, name: string]
从控制台的提示可以得知,我们成功创建了一个DataFrame的对象,包含age和name两个字段。
而DataFrame自带的玩法就多了:// 输出表结构df.printSchema()// 选择所有年龄大于21岁的人,只保留name字段df.filter(df("age") > 21).select("name").show()// 选择name,并把age字段自增df.select("name", df("age") + 1).show()// 按年龄分组计数df.groupBy("age").count().show()// 左联表(注意是3个等号!)df.join(df2, df("name") === df2("name"), "left").show()

声明声明:本网页内容为用户发布,旨在传播知识,不代表本网认同其观点,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。E-MAIL:11247931@qq.com