pyflink作业提交中的踩坑经历累积经验避免重复犯错
发布时间
阅读量:
阅读量
Flink正致力于将Python生态系统与大数据生态进行整合,然而当前版本尚未达到完全成熟的状态。特别是在官方提供的Python相关资料相对有限的情况下,用户若希望借助Python完成Flink任务并将其提交至Flink平台,仍需经历诸多挑战与调试过程。
针对PyFlink环节中从编写Python任务到最终提交所涉及的问题,以下内容进行了系统性总结,旨在帮助用户减少不必要的试错与重复工作。
一、部署环境
JDK 1.8及以上版本 & Python 3.5及以上版本(推荐3.7.6)& Apache Flink 1.12 & PyFlink 1.0
二、官方API
Flink为开发者提供了多层级的API接口,对于Python用户而言,主要依赖于Table API和SQL API。个人认为Table API在功能上与Python的Dataframe存在一定的相似性,因此在实际开发过程中更倾向于使用Table API进行作业编写。用户可通过查阅对应版本的官方文档及示例代码来学习如何应用这些API。官网1.12版文档地址:https://ci.apache.org/projects/flink/flink-docs-release-1.12/dev/table/tableApi.html
需要注意的是,在当前阶段建议优先参考官方文档进行学习。由于PyFlink各版本之间存在
全部评论 (0)
还没有任何评论哟~
