多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?

近日,中国图象图形大会(CCIG 2023)在苏州圆满落幕。本届大会以“图象图形·向未来”为主题,由中国科学技术协会指导,中国图象图形学学会主办,苏州科技大学承办,特邀谭铁牛院士、*院士、吴一戎院士等百余位国内外知名学者以及来自代表企业的技术专家,共话图像图形学术研究与技术创新趋势,共谋行业新发展。

图说:图像图形学术研究与技术创新趋势 采访对象供图 (下同)

近期,ChatGPT的爆火让“大模型”技术进入了公众的视野。随着人工智能技术的飞速发展,作为图像图形技术的重要应用场景之一,文档图像智能处理逐步应用到医疗、教育等诸多领域,为各行各业提供更加高效、智能的文档管理和数据分析解决方案,大模型技术的崛起也为文档处理带来了新的机遇。

技术论坛《文档图像智能分析与处理》是本次大会的亮点之一。论坛上,中国科学院自动化研究所副所长*林认为,大模型与光学字符识别(OCR)技术的结合,能够对海量数据进行理解、处理。具体到实践层面,大模型技术还有可观的提升空间。从识别性能来说,大模型技术在场景文本、逻辑版面、文档问答等方面还有很多工作可以做;此外,大模型的可解释性、安全度十分重要,还需要研究者们进行更为深入的探讨。

北京大学邹月娴教授认为,在与文档图像处理技术密切相关的OCR领域中,专业化大规模的预训练模型是可行的,“大模型是一个大的趋势,对于小团队来说做工具是一个非常好的方法,做工具对大家都是有好处的”。

华为AI研究员廖明辉提到,企业作为文档图像处理的应用方,普遍面临一个挑战:当有众多API时,维护难度较高,急需一个垂直领域的通用的OCR大模型,能够覆盖所有的使用场景。廖明辉认为,OCR垂直领域的大模型在数据量方面,数据的数量不是关键的,关键的是数据的多样性。

除了引入大模型等新技术外,如何实现文档图像的智能分析与处理还面临着诸多来自现实的挑战。合合信息智能技术平台事业部副总经理、高级工程师丁凯博士认为,文档的多样性和复杂性是文档图像处理中的难点:文档类型和格式繁多,包括报告、合同、*、证明、证件等。不同类型的文档有不同的格式和布局,例如文档中常常包含图片、表格、图形等各种图像,难以用统一的方法处理。

丁凯提到,文档图像中的弯曲、阴影、摩尔纹、字迹不清晰等问题对文档图像的识别与处理产生了影响。*林也表示:“过去我们只关注文字,现在文档中的图像也十分重要。但是,现有文档图像识别技术在识别精度和可靠性、可解释性、自适应性等方面还有明显不足,还有很多技术问题有待解决。”

值得关注的是,人工智能大模型的快速发展为文档分析与识别带来了一些机遇,除了解决识别层次的遗留问题,在性能提升、应用拓展上大有可为。合合信息通过ROI提取、干扰去除、形变矫正、图像恢复以及图像增强这一整体架构对文档进行智能扫描与识别分析,将文档图像的弯曲矫正、摩尔纹去除,图像质量大幅提升。

除文档图像的通用场景外,合合信息对特定垂直场景下的图像也能进行预处理,针对手写板图片*现的反光问题,通过算法模型对反光进行“擦除”。

由于版面复杂多变、文本内容多样化等原因,文档被拍照、扫描成电子文档过程中时常出现漏字、错位,合合信息持续突破版面分析技术在版面分割、区域间的逻辑关系处理等方面的难题,通过智能文字识别、智能图像处理等核心技术,确定文档中的文字位置、字体、大小和排版方式等信息,实现版面的分析和还原。

新民晚报记者 金志刚

以上就是【多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?】的相关内容,查看其它ai资讯请关注微咔网

服务及版权声明

根据二〇〇二年一月一日《计算机软件保护条例》第十七条规定:为了学习和研究软件内含的设计思想和原理,通过安装、显示、传输或者存储软件等方式使用软件的,可以不经软件著作权人许可,不向其支付报酬。

本网站所有发布的源码、软件和资料,均为作者提供或网友推荐收集各大资源网站整理而来,仅供功能验证和学习研究使用。

所有资源的文字介绍均为网络转载,本站不保证相关内容真实可信,同时不保证所有资源100%无错可用,也不提供相应的技术支持,介意勿下。

您必须在下载后24小时内删除,不得用于非法商业用途,不得违反国家法律,一切关于该资源的商业行为与本站无关。

如果您喜欢该程序,请支持正版源码,得到更好的正版服务。、如有侵犯你的版合法权益,请邮件与我们联系处理【投诉/建议发送至邮箱:3066548754@qq.com】,本站将立即改正并删除。

本声明为本站所有资源最终声明,所有与本声明不符的表述均以本声明内容为准。


微咔网 » 多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?
享更多特权,建议使用 QQ 登录
喜欢我嘛?喜欢就按“ctrl+D”收藏我吧!♡