基米工具箱v0.3开源发布
在前面两篇文章中,我做了一款python工具箱,今天,又再次迎来了一次更新。
这一次更新呢,我正式给工具做了命名,之前命名是python工具箱,是没啥个性的名称,因为想着是开源、可以给大家随便拿着二次开发的,就没命名一些个性化的名称。
现在呢,我想把这个工具更加地产品化,于是正式更名为基米工具箱。叫这个名字有几点原因:
-
工具不太正式:因为我也不是IT科班出身,所以没有起比较正式的名字,用了一个比较诙谐的名字。 -
取自哈基米:首先,哈基米是有指猫的意思,我挺喜欢猫。还有,工具箱的代码是主要依靠Gemini写的,因为Gemini的读音也有人叫它为哈基米。
下面,我将从以下方面,对工具箱进行更具体的介绍:
-
主要更新情况 -
下载、安装、卸载;有那些功能 -
主要功能使用说明 -
后续方向
1. 主要更新情况
本次更新包括以下方面:
-
更加产品化: -
工具有了个性化的名字、icon -
封装为了setup.exe,一键安装和卸载
-
-
架构更新:以前exe启动要几十秒,现在启动速度秒起🚀 -
功能懒加载:启动exe时不会一下加载全部功能,只有使用时才加载 -
重型库懒加载:大型python库也不会在一开始加载,使用功能时才加载 -
打包优化:所有python库都没打包进exe里
-
-
功能优化:对一些功能作出了优化,新增了polars库,数据提取速度嘎嘎起飞🚀
2. 下载安装和功能模块
下载地址:
大家下载之后,会拿到这个setup.exe文件:
双击运行,与安装正常的应用程序一样,点击安装即可:
这一次,我没有像之前一样,把exe、assets、build、mian等等乱七八糟的文件都放在了,而是有更精简的文件分享,另外,卸载的话也和卸载正常程序一样,可通过控制面板卸载。
为了保持文件分享的简洁,源码我也不附上了,如需源码,可在github上下载:
点击这个链接进去,即可看到对应的代码文件。
功能模块
相较之前版本,功能模块没有更新,但功能上有部分优化:
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
3. 功能使用说明
其中,大部分功能,我已经在前两篇文章里说过。
而且,很多功能,使用起来很简单,基本都有提示,所以我也不再赘述了。
下面对一些稍复杂的功能,补充一些具体细节。
1. Excel数据提取
数据与需求情况:
下面,我以最复杂的情况,来演示这个功能:
有这么几份序时账(当然,也可以是别的东西):
-
• 表头乱七八糟:它的表头都不在第1行,而且有合并单元格: -
• Excel里有好几个工作表:有序时账、科目余额表两个表,我只要序时账 -
• 每个Excel的工作表名称不一样:比如有1月序时账、2月序时账等 -
• 每个Excel的序时账字段不一样:有点序时账叫[借方金额,贷方金额],有的序时账叫[借方,贷方]
长这样:
我现在,需要提取出每个序时账的这几列:
[凭证编号,摘要,借方金额,贷方金额]
执行提取:
Step1.上传文件夹
这里我把包含多个序时账文件的文件夹上传,并选择了递归遍历,效果是会提取这个文件夹里所有的子文件夹里的文件。
如果不勾选递归遍历,则只提取本级文件夹下的文件。
Step2.设置提取规则
-
• 1.只要序时账工作表:同时注意,每个表序时账名称不一样,以此是1月序时账,2月序时账… -
• 2.只要部分列:只要4列,但注意,有点表里的借方金额、贷方金额列表述不一致
这里我的配置是这样的:
{
"指定工作表": {
"名称": "序时账",
"精确匹配工作表名称": false # 未开启
},
"提取列模式": {
"启用": true, # 开启
"精确匹配列": ["凭证编号", "摘要"],
"模糊匹配列": ["借方", "贷方"]
}
}]
Step3.处理引擎选择
-
• 稳定模式:Pandas+保存为xlsx -
• 极速模式:Polars+保存为csv
如果提取的数据量很大,合计可能超过30万行的,推荐采用极速模式,速度会是pandas模式的5-10倍。
这里还有个瑕疵,polars模式的fastexcel现在只能读取位于第1行的列头,所以如果列头不在第1行的话,只能用pandas模式。
如果polars模式有其他bug的话,也请用回pandas模式,pandas是最稳定兼容的。
最终结果:
这里出现了借方、借方1,是因为我们模糊匹配时,匹配严格度设置的比较低,借方也直接和贷方模糊匹配上了。实际上,这个借方1就是贷方。
2. Excel内容检索和外部链接替换
先说内容检索,比如在一堆底稿中,我们想检查有没有敏感词汇,比如说有没有一些错误值,像是#REF!、#VALUE!、#N/A之类的。
每个字段,注意用|隔开。
另外,这里还有个rust模式,就会更一点,不过rust模式只能找纯文字,不能找这些乱码值。
然后是外部链接替换。
比如,我有一个AA.xlsx,它有这么几项外部链接,并且我想进行这几种类型的替换:
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
替换步骤:
Step1.上传Excel工作簿
注意,上传文件还是在这里上传:
Step2.导出并填写外部链接映射表
填写情况:
填写时请务必参考我这个外部链接映射表的填写方式,这里注意,如只跟换sheet名,不更换路径,新链接路径可留空。
地址怎么填?点击复制文件地址即可:
最后,点击执行,即可进行转换,注意,执行转换时应关闭导入的(即AA.xlsx)文件。
在主要功能里,只有这两个功能配置参数需要比较注意的,其他配置参数都比较简单,而且前文已经基本讲过了,就不再赘述了。
4. 后续方向
-
工具拆分:
目前工具体积太大了,因为集成了比较多的内容。目前大概混杂了100多个python库,非常臃肿混杂。
所以,后续我会将工具拆分为好几个工具,分别拆分为[银行流水、序时账、通用办公类]。
所以,目前的v0.3版本不出意外的话,可能就是最后一版了。后面再更新,我可能会连着发好几个工具。 -
工具未来融入的元素
-
OCR:预计将 PP-OCRv5模型融入工具,实现本地OCR。 -
优化机器学习算法:在序时账工具模块里优化和加入更多的机器学习算法 -
寻找AI功能的边界:目前感觉,AI功能的应用很窄,后续再看一下有没有更好的点子,如果没有,我可能会删除工具里的AI功能。
在后续内容更新中,技术类内容就会比较少了,而是发一些知识类(吹牛比类)的内容(之前还欠下了一篇应收账款迁徙率模型前瞻性调整的内容)。
还有一份0基础打造python工具的文章不知道要不要发,感觉没啥人看。
另外,工具如有bug可以给我留言或私信,造成不便之处麻烦谅解~
看完不过瘾,那就自己发一篇吧!






![表情[nanguo]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/nanguo.gif)
![表情[haobang]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/haobang.gif)
![表情[shuai]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/shuai.gif)
![表情[deyi]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/deyi.gif)
![表情[chi]-寻找资源网](http://www.seekresource.com/wp-content/themes/zibll/img/smilies/chi.gif)



暂无评论内容