Questions et réponses pour le apache-spark-sql :

Apache Spark SQL est un outil de «traitement SQL et de données structurées» sur Spark, un système de calcul en cluster rapide et polyvalent. Il peut être utilisé pour récupérer des données de Hive, Parquet, etc. et exécuter des requêtes SQL sur les RDD et les ensembles de données existants.

4
votes
J'ai un dataframe Pandas. J'ai essayé de joindre d'abord deux colonnes contenant des valeurs de chaîne dans une liste, puis en utilisant zip, j'ai joint chaque élément d ...

4
votes
Je souhaite pouvoir récupérer la valeur location d'une table Hive à partir d'un objet Spark (SparkSession). Une façon d'obtenir cette valeur consiste ...

3
votes
J'ai l'exemple de dataframe suivant +---+----+--------------------+-------------+-------------------------+ | ID|name| fruit| qty| Result| +---+----+- ...

3
votes
J'ai essayé deux méthodes pour trouver des rangées distinctes dans le parquet, mais cela ne semble pas fonctionner. Attemp 1: Dataset df = ...