我在一个函数应用程序中有一个blob存储触发器,我从存储容器中获取镶木地板文件,将数据转换为数据帧,并将数据插入Azure SQL DB。
我通过将函数限制在一台机器上并设置
"batchSize": 1
在我的host.json文件中。
我之所以选择这样做,是因为当我允许脚本并行运行时,有时实例会发生冲突,并试图同时访问同一个表,从而导致问题。
这很好,但显然相当慢。尤其是在最初运行的文件量很大的情况下。我还决定甚至不运行更大的文件(超过2mb的文件),因为我宁愿侧载它们,也不愿保持功能。
我只是在寻找如何加快这一过程的建议/方向?此外,一个2 MB或更大的镶木地板文件花很长时间做我正在做的事情是正常的吗?我觉得2mb不是一个很大的文件大小,但我没有任何参考资料。
一些附加信息:我的脚本的主要依赖项是panda(数据帧)和SQL Alchemy(特别是to_SQL(),用于将数据帧中的数据插入数据库)