일 | 월 | 화 | 수 | 목 | 금 | 토 |
---|---|---|---|---|---|---|
1 | 2 | 3 | 4 | 5 | ||
6 | 7 | 8 | 9 | 10 | 11 | 12 |
13 | 14 | 15 | 16 | 17 | 18 | 19 |
20 | 21 | 22 | 23 | 24 | 25 | 26 |
27 | 28 | 29 | 30 |
- Data Engineer
- 개발
- Data Engineering
- 자바
- dfs
- bigdata engineering
- 코엑스맛집
- 맛집
- 코테
- 여행
- HIVE
- 알고리즘
- 프로그래머스
- bigdata engineer
- 용인맛집
- java
- Spark
- 삼성역맛집
- hadoop
- pyspark
- Trino
- BFS
- 코엑스
- 코딩테스트
- 코딩
- Iceberg
- BigData
- 백준
- 영어
- apache iceberg
- Today
- Total
목록pyspark (4)
지구정복

NiFi 1.15.2Spark 3.1.4Iceberg 1.3.1Hive 3.1.3 마지막 HDFS에 저장된 gzip.parquet 파일을 읽어서 Iceberg Table로 적재하는 PySpark Streaming을 실행한다. 미리 Iceberg Table은 생성되어야 있어야 하므로 PySpark로 만들어준다.#iceberg table 생성쿼리q="""CREATE TABLE iceberg_test_db.test_table_name ( data STRING, log_timestamp timestamp_ntz)USING icebergPARTITIONED BY (days(log_timestamp))TBLPROPERTIES ( 'read.parquet.vectorization.enabled..
pyspark3 --master yarn --deploy-mode client \ --executor-memory 20g \ --executor-cores 5 --num-executors 30 \ --conf spark.pyspark.python=/usr/bin/python3.7 \ --conf spark.pyspark.driver.python=/usr/bin/python3.7 \ --conf spark.yarn.appMasterEnv.PYSPARK_PYTHON=/usr/bin/python3.7 \ --conf spark.yarn.appMasterEnv.PYSPARK_DRIVER_PYTHON=/usr/bin/python3.7 \ --conf spark.driver.maxResultSize=3g --dr..
Spark를 이용해서 Hive 테이블 쓰기 작업중 아래 에러가 발생했다.com.streamsets.datatransformer.dag.error.OperatorFailureException: Operator Hive_01 failed due to org.apache.spark.SparkException at com.streamsets.datatransformer.dag.BaseBatchDAGRunner.com$streamsets$datatransformer$dag$BaseBatchDAGRunner$$generateOperatorFailure(BaseBatchDAGRunner.scala:664) at com.streamsets.datatransformer.dag.BaseBatchDAGRunner$$anon..

spark dataframe을 hive table로 저장하려고 할 때 아래 에러 발생했다.StreamingQueryException: [STREAM_FAILED] Query [id = 212088e9-127b-408d-84fa-bc47345e6f77, runId = 303af654-dffd-4218-a813-2b270be37aa3] terminated with exception: An exception was raised by the Python Proxy. Return Message: Traceback (most recent call last): File "/usr/local/src/miniconda/py38-16/lib/python3.8/site-packages/py4j/clientserver.py..