IT人力外包人才简历库

返回列表

Python开发工程师(爬虫方向)

驻场外包人员
工作年限:1年 意向城市:杭州 浏览:6次 发布时间:近期

技能标签

Python Scrapy MongoDB MySQL 分布式爬虫 网络请求 数据解析 数据库优化 Linux系统 日志监控 爬虫架构 去重算法 协程技术 URL管理 断点续爬

专业技能

精通Python核心语法及数据结构,熟练掌握装饰器、列表推导式等高级特性;精通Scrapy框架开发,具备分布式爬虫(Scrapy-Redis)部署经验;熟练使用requests、re、BeautifulSoup等网络请求与解析库;掌握MySQL与MongoDB数据库增删改查操作,具备连接池优化经验;熟悉Linux系统环境搭建与命令行操作,具备日志监控与性能调优能力

工作履历(脱敏处理)

专注于网络爬虫系统开发,主导设计并实现基于Scrapy-Redis的分布式爬虫架构,支持百万级URL调度与并发处理。优化数据库连接池配置,将数据写入效率提升40%。开发URL去重模块,采用布隆过滤器与Redis结合方案,降低内存占用并提升去重准确率。设计断点续爬机制,实现爬虫任务中断后自动恢复,保障数据完整性。构建网址池管理系统,支持增量爬取与未爬取URL的智能调度。开发协程爬虫方案,通过异步I/O提升爬取效率,单机爬取速度提升3倍。完成B站视频数据采集项目,实现网页源码解析、数据清洗与存储全流程开发。

项目经验(脱敏处理)

1. 网站数据采集系统开发:设计基于Scrapy-Redis的分布式爬虫架构,采用布隆过滤器实现URL去重,通过断点续爬机制保障数据完整性。解决高并发场景下的请求频率控制问题,使用代理IP池和UserAgent池实现反反爬策略,成功采集10+目标网站数据。

2. 协程爬虫优化项目:基于aiohttp与asyncio开发异步爬虫框架,通过事件循环机制提升I/O效率。采用连接池复用技术降低请求延迟,单机爬取速度较传统线程池方案提升3倍。开发基于Redis的分布式任务队列,支持横向扩展与负载均衡。

3. 数据仓库采集系统:设计MySQL与MongoDB混合存储方案,通过ETL流程实现数据清洗与结构化存储。优化慢查询SQL,将数据导入耗时降低60%。构建日志监控系统,实时追踪爬虫状态并生成可视化报表,保障数据采集稳定性。

驻场外包优势

服从性高

严格遵守甲方管理制度

技术扎实

1年项目实战经验

可长期驻场

接受异地项目外派

快速响应

24小时内可到岗

企业人才对接

专业IT人力外包服务

如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。

合作热线

18969108718

商务邮箱

ntit@163.com

微信扫码咨询

微信咨询二维码

扫描二维码添加商务对接

立即申请人才对接