/ / Scala Spark Dataframe - Policz liczbę łańcuchów dla każdego wiersza w kolumnie tablicy - scala, apache-spark, apache-spark-sql, databricks

Scala Spark Dataframe - Policz liczbę łańcuchów dla każdego wiersza w kolumnie tablicy - scala, apache-spark, apache-spark-sql, databricks

Jestem nowy w programowaniu Scala i to jest moje pytanie: Jak policzyć numer łańcucha dla każdego wiersza? Moja ramka danych składa się z pojedynczej kolumny typu Array [String].

friendsDF: org.apache.spark.sql.DataFrame = [friends: array<string>]

Odpowiedzi:

6 dla odpowiedzi № 1

Możesz użyć size funkcjonować:

val df = Seq((Array("a","b","c"), 2), (Array("a"), 4)).toDF("friends", "id")
// df: org.apache.spark.sql.DataFrame = [friends: array<string>, id: int]

df.select(size($"friends").as("no_of_friends")).show
+-------------+
|no_of_friends|
+-------------+
|            3|
|            1|
+-------------+

Aby dodać jako nową kolumnę:

df.withColumn("no_of_friends", size($"friends")).show
+---------+---+-------------+
|  friends| id|no_of_friends|
+---------+---+-------------+
|[a, b, c]|  2|            3|
|      [a]|  4|            1|
+---------+---+-------------+