技能标签
专业技能
精通Python语言及Requests、Selenium、Scrapy等爬虫框架,擅长构建分布式爬虫系统及IP池管理。熟练掌握多线程/异步协程技术,具备百万级数据采集经验。精通HTML/CSS解析技术,熟练使用XPath、正则表达式及BeautifulSoup进行数据提取。掌握NLP领域LSTM、BERT等深度学习模型,具备文本分词、情感分析及语义标注能力。熟悉numpy、pandas等数据分析工具,精通matplotlib数据可视化技术。具备大规模日志分析及数据清洗处理经验。
工作履历(脱敏处理)
主导数据采集系统架构设计,采用Scrapy+Redis+Celery构建分布式爬虫框架,实现百万级数据采集效率提升。开发智能反反爬策略,通过动态IP池管理和请求头模拟技术突破网站反爬机制。搭建NLP分析平台,基于BERT模型实现评论情感分析,准确率达92%。设计数据清洗流程,使用pandas进行数据去重和特征提取,构建可视化分析报告。优化爬虫性能,通过异步协程技术将采集效率提升300%。
项目经验(脱敏处理)
1. 知乎问答数据采集项目:基于Selenium实现多进程爬虫,采用动态代理IP池应对反爬策略,完成1万+条高质量问答数据采集,建立基于TF-IDF的关键词提取模型。
2. 微博评论分析项目:构建Scrapy-Redis分布式爬虫系统,集成账号池管理技术,完成百万级评论数据采集,通过正则表达式和XPath实现用户信息提取,建立评论情感分析模型。
3. NLP文本处理平台:开发基于BERT的文本分类系统,实现评论分词、情感打标及主题聚类,构建可视化分析看板,支持多维度数据透视分析。
驻场外包优势
服从性高
严格遵守甲方管理制度
技术扎实
1年项目实战经验
可长期驻场
接受异地项目外派
快速响应
24小时内可到岗
企业人才对接
专业IT人力外包服务
如果贵公司有IT项目人手缺口、需要工程师驻场开发、短期人力支援需求,欢迎联系洽谈合作。
合作热线
18969108718
商务邮箱
ntit@163.com
微信扫码咨询
扫描二维码添加商务对接