v1.0.12: parser.cfm — рефакторинг + ZIP (подпапки, PDF/DOCX)
This commit is contained in:
@@ -1 +1 @@
|
|||||||
<cfsetting showdebugoutput=no enablecfoutputonly=yes><cfoutput>OK v1.0.11</cfoutput>
|
<cfsetting showdebugoutput=no enablecfoutputonly=yes><cfoutput>OK v1.0.12</cfoutput>
|
||||||
|
|||||||
+228
-183
@@ -3,202 +3,256 @@
|
|||||||
|
|
||||||
<cfparam name="url.doc_id" default="">
|
<cfparam name="url.doc_id" default="">
|
||||||
|
|
||||||
<cfset result = {ok: false, error: ""}>
|
<!--- ═══════════════════════════════════════════════════════════
|
||||||
|
Helper: parsePDF — PDFBox → {elements, errors}
|
||||||
|
═══════════════════════════════════════════════════════════ --->
|
||||||
|
<cffunction name="parsePDF" access="private" returntype="struct">
|
||||||
|
<cfargument name="fileBytes" type="binary">
|
||||||
|
<cfset var out = {elements: [], errors: []}>
|
||||||
|
<cftry>
|
||||||
|
<cfset var bais = createObject("java", "java.io.ByteArrayInputStream").init(fileBytes)>
|
||||||
|
<cfset var bis = createObject("java", "java.io.BufferedInputStream").init(bais)>
|
||||||
|
<cfset var pdfDoc = 0>
|
||||||
|
<cftry>
|
||||||
|
<cfset pdfDoc = createObject("java", "org.apache.pdfbox.Loader").loadPDF(bis)>
|
||||||
|
<cfcatch>
|
||||||
|
<cftry>
|
||||||
|
<cfset pdfDoc = createObject("java", "org.apache.pdfbox.pdmodel.PDDocument").load(bis)>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset arrayAppend(out.errors, "PDFBox: cannot open — " & cfcatch.message)>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfif NOT isNumeric(pdfDoc)>
|
||||||
|
<cfset var stripper = createObject("java", "org.apache.pdfbox.text.PDFTextStripper")>
|
||||||
|
<cfset var pageCount = pdfDoc.getNumberOfPages()>
|
||||||
|
<cfloop from="1" to="#pageCount#" index="var pn">
|
||||||
|
<cfset stripper.setStartPage(pn)>
|
||||||
|
<cfset stripper.setEndPage(pn)>
|
||||||
|
<cfset var pageText = stripper.getText(pdfDoc)>
|
||||||
|
<cfif len(trim(pageText))>
|
||||||
|
<cfloop list="#pageText#" index="var line" delimiters="#chr(10)#">
|
||||||
|
<cfset line = trim(line)>
|
||||||
|
<cfif len(line)>
|
||||||
|
<cfset arrayAppend(out.elements, {type: "paragraph", style: "", text: line, page: pn})>
|
||||||
|
</cfif>
|
||||||
|
</cfloop>
|
||||||
|
</cfif>
|
||||||
|
</cfloop>
|
||||||
|
<cfset pdfDoc.close()>
|
||||||
|
</cfif>
|
||||||
|
<cfset bis.close()>
|
||||||
|
<cfset bais.close()>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset arrayAppend(out.errors, "PDFBox: " & cfcatch.message)>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfreturn out>
|
||||||
|
</cffunction>
|
||||||
|
|
||||||
|
<!--- ═══════════════════════════════════════════════════════════
|
||||||
|
Helper: parseDOCX — ZIP/XML → {elements, errors}
|
||||||
|
═══════════════════════════════════════════════════════════ --->
|
||||||
|
<cffunction name="parseDOCX" access="private" returntype="struct">
|
||||||
|
<cfargument name="fileBytes" type="binary">
|
||||||
|
<cfset var out = {elements: [], errors: []}>
|
||||||
|
<cftry>
|
||||||
|
<cfset var bais = createObject("java", "java.io.ByteArrayInputStream").init(fileBytes)>
|
||||||
|
<cfset var zis = createObject("java", "java.util.zip.ZipInputStream").init(bais)>
|
||||||
|
<cfset var xmlStr = "">
|
||||||
|
<cfloop condition="true">
|
||||||
|
<cfset var entry = zis.getNextEntry()>
|
||||||
|
<cfif isNull(entry)><cfbreak></cfif>
|
||||||
|
<cfif entry.getName() EQ "word/document.xml">
|
||||||
|
<cftry>
|
||||||
|
<cfset var xmlBytes = zis.readAllBytes()>
|
||||||
|
<cfset xmlStr = createObject("java", "java.lang.String").init(xmlBytes, "UTF-8")>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset var baos = createObject("java", "java.io.ByteArrayOutputStream").init()>
|
||||||
|
<cfloop condition="true">
|
||||||
|
<cfset var b = zis.read()>
|
||||||
|
<cfif b LT 0><cfbreak></cfif>
|
||||||
|
<cfset baos.write(b)>
|
||||||
|
</cfloop>
|
||||||
|
<cfset xmlStr = createObject("java", "java.lang.String").init(baos.toByteArray(), "UTF-8")>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfbreak>
|
||||||
|
</cfif>
|
||||||
|
<cfset zis.closeEntry()>
|
||||||
|
</cfloop>
|
||||||
|
<cfset zis.close()>
|
||||||
|
<cfset bais.close()>
|
||||||
|
<cfif NOT len(xmlStr)>
|
||||||
|
<cfset arrayAppend(out.errors, "word/document.xml not found")>
|
||||||
|
<cfelse>
|
||||||
|
<cfset var docXml = xmlParse(xmlStr)>
|
||||||
|
<cfset var body = "">
|
||||||
|
<cftry>
|
||||||
|
<cfset body = xmlSearch(docXml, "//:body")>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset body = xmlSearch(docXml, "//*[local-name()='body']")>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfif arrayLen(body) GT 0>
|
||||||
|
<cfset body = body[1]>
|
||||||
|
<cfloop array="#body.XmlChildren#" index="var child">
|
||||||
|
<cfset var localName = child.XmlName>
|
||||||
|
<cfif localName EQ "p" OR right(localName, 2) EQ ":p">
|
||||||
|
<cfset var paraText = "">
|
||||||
|
<cftry>
|
||||||
|
<cfset var textNodes = xmlSearch(child, "//:t")>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset textNodes = xmlSearch(child, "//*[local-name()='t']")>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfloop array="#textNodes#" index="var tn">
|
||||||
|
<cfset paraText &= tn.XmlText>
|
||||||
|
</cfloop>
|
||||||
|
<cfset paraText = trim(paraText)>
|
||||||
|
<cfif len(paraText)>
|
||||||
|
<cfset arrayAppend(out.elements, {type: "paragraph", style: "", text: paraText, page: 0})>
|
||||||
|
</cfif>
|
||||||
|
<cfelseif localName EQ "tbl" OR right(localName, 4) EQ ":tbl">
|
||||||
|
<cfset var rows = []>
|
||||||
|
<cftry>
|
||||||
|
<cfset var trNodes = xmlSearch(child, "//:tr")>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset trNodes = xmlSearch(child, "//*[local-name()='tr']")>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfloop array="#trNodes#" index="var trNode">
|
||||||
|
<cfset var row = []>
|
||||||
|
<cftry>
|
||||||
|
<cfset var tcNodes = xmlSearch(trNode, ".//:tc")>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset tcNodes = xmlSearch(trNode, ".//*[local-name()='tc']")>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfloop array="#tcNodes#" index="var tcNode">
|
||||||
|
<cfset var cellText = "">
|
||||||
|
<cftry>
|
||||||
|
<cfset var tNodes = xmlSearch(tcNode, ".//:t")>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset tNodes = xmlSearch(tcNode, ".//*[local-name()='t']")>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfloop array="#tNodes#" index="var tNode">
|
||||||
|
<cfset cellText &= tNode.XmlText>
|
||||||
|
</cfloop>
|
||||||
|
<cfset arrayAppend(row, trim(cellText))>
|
||||||
|
</cfloop>
|
||||||
|
<cfif arrayLen(row) GT 0>
|
||||||
|
<cfset arrayAppend(rows, row)>
|
||||||
|
</cfif>
|
||||||
|
</cfloop>
|
||||||
|
<cfif arrayLen(rows) GT 0>
|
||||||
|
<cfset arrayAppend(out.elements, {type: "table", rows: rows, page: 0})>
|
||||||
|
</cfif>
|
||||||
|
</cfif>
|
||||||
|
</cfloop>
|
||||||
|
<cfelse>
|
||||||
|
<cfset arrayAppend(out.errors, "body not found")>
|
||||||
|
</cfif>
|
||||||
|
</cfif>
|
||||||
|
<cfcatch>
|
||||||
|
<cfset arrayAppend(out.errors, "DOCX: " & cfcatch.message)>
|
||||||
|
</cfcatch>
|
||||||
|
</cftry>
|
||||||
|
<cfreturn out>
|
||||||
|
</cffunction>
|
||||||
|
|
||||||
|
<!--- ═══════════════════════════════════════════════ MAIN --->
|
||||||
|
<cfset result = {ok: false, error: ""}>
|
||||||
<cftry>
|
<cftry>
|
||||||
<cfif NOT len(url.doc_id)>
|
<cfif NOT len(url.doc_id)>
|
||||||
<cfset result.error = "doc_id required">
|
<cfset result.error = "doc_id required">
|
||||||
<cfelse>
|
<cfelse>
|
||||||
<!--- Читаем документ из БД --->
|
|
||||||
<cfquery name="doc" datasource="baza">
|
<cfquery name="doc" datasource="baza">
|
||||||
SELECT id, filename, mime_type, original_bytes, status
|
SELECT id, filename, mime_type, original_bytes, status
|
||||||
FROM documents
|
FROM documents WHERE id = <cfqueryparam value="#url.doc_id#" cfsqltype="cf_sql_varchar">
|
||||||
WHERE id = <cfqueryparam value="#url.doc_id#" cfsqltype="cf_sql_varchar">
|
|
||||||
</cfquery>
|
</cfquery>
|
||||||
|
|
||||||
<cfif doc.recordCount EQ 0>
|
<cfif doc.recordCount EQ 0>
|
||||||
<cfset result.error = "document not found">
|
<cfset result.error = "document not found">
|
||||||
<cfelse>
|
<cfelse>
|
||||||
<cfset elements = []>
|
<cfset elements = []>
|
||||||
<cfset errors = []>
|
<cfset errors = []>
|
||||||
|
<cfset files = []>
|
||||||
|
|
||||||
<!--- PDF --->
|
<!--- ZIP: поиск PDF/DOCX во всех подпапках --->
|
||||||
<cfif doc.mime_type EQ "application/pdf">
|
<cfif doc.mime_type EQ "application/zip">
|
||||||
<cftry>
|
<cftry>
|
||||||
<!--- Base64 → байты --->
|
<cfset var zipBytes = binaryDecode(doc.original_bytes, "base64")>
|
||||||
<cfset fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
<cfset var zbais = createObject("java", "java.io.ByteArrayInputStream").init(zipBytes)>
|
||||||
<!--- Байты → InputStream --->
|
<cfset var zzis = createObject("java", "java.util.zip.ZipInputStream").init(zbais)>
|
||||||
<cfset bais = createObject("java", "java.io.ByteArrayInputStream").init(fileBytes)>
|
|
||||||
<cfset bis = createObject("java", "java.io.BufferedInputStream").init(bais)>
|
|
||||||
|
|
||||||
<!--- Пробуем PDFBox 3.x Loader, иначе 2.x PDDocument.load --->
|
|
||||||
<cfset pdfDoc = 0>
|
|
||||||
<cftry>
|
|
||||||
<cfset pdfDoc = createObject("java", "org.apache.pdfbox.Loader").loadPDF(bis)>
|
|
||||||
<cfcatch>
|
|
||||||
<cftry>
|
|
||||||
<cfset pdfDoc = createObject("java", "org.apache.pdfbox.pdmodel.PDDocument").load(bis)>
|
|
||||||
<cfcatch>
|
|
||||||
<cfset arrayAppend(errors, "PDFBox: cannot open PDF — " & cfcatch.message)>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
<cfif NOT isNumeric(pdfDoc)>
|
|
||||||
<cfset stripper = createObject("java", "org.apache.pdfbox.text.PDFTextStripper")>
|
|
||||||
|
|
||||||
<cfset pageCount = pdfDoc.getNumberOfPages()>
|
|
||||||
<cfloop from="1" to="#pageCount#" index="pn">
|
|
||||||
<cfset stripper.setStartPage(pn)>
|
|
||||||
<cfset stripper.setEndPage(pn)>
|
|
||||||
<cfset pageText = stripper.getText(pdfDoc)>
|
|
||||||
<cfif len(trim(pageText))>
|
|
||||||
<cfloop list="#pageText#" index="line" delimiters="#chr(10)#">
|
|
||||||
<cfset line = trim(line)>
|
|
||||||
<cfif len(line)>
|
|
||||||
<cfset arrayAppend(elements, {type: "paragraph", style: "", text: line, page: pn})>
|
|
||||||
</cfif>
|
|
||||||
</cfloop>
|
|
||||||
</cfif>
|
|
||||||
</cfloop>
|
|
||||||
|
|
||||||
<cfset pdfDoc.close()>
|
|
||||||
</cfif>
|
|
||||||
<cfset bis.close()>
|
|
||||||
<cfset bais.close()>
|
|
||||||
|
|
||||||
<cfcatch>
|
|
||||||
<cfset arrayAppend(errors, "PDFBox: " & cfcatch.message)>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
|
|
||||||
<!--- DOCX — ZIP/XML (POI не нужен) --->
|
|
||||||
<cfelseif doc.mime_type EQ "application/vnd.openxmlformats-officedocument.wordprocessingml.document">
|
|
||||||
<cftry>
|
|
||||||
<cfset fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
|
||||||
<cfset bais = createObject("java", "java.io.ByteArrayInputStream").init(fileBytes)>
|
|
||||||
<cfset zis = createObject("java", "java.util.zip.ZipInputStream").init(bais)>
|
|
||||||
|
|
||||||
<cfset xmlStr = "">
|
|
||||||
<cfloop condition="true">
|
<cfloop condition="true">
|
||||||
<cfset entry = zis.getNextEntry()>
|
<cfset var zentry = zzis.getNextEntry()>
|
||||||
<cfif isNull(entry)><cfbreak></cfif>
|
<cfif isNull(zentry)><cfbreak></cfif>
|
||||||
<cfif entry.getName() EQ "word/document.xml">
|
<cfset var zname = zentry.getName()>
|
||||||
<cftry>
|
<cfif right(zname, 1) EQ "/">
|
||||||
<cfset xmlBytes = zis.readAllBytes()>
|
<cfset zzis.closeEntry()><cfcontinue>
|
||||||
<cfset xmlStr = createObject("java", "java.lang.String").init(xmlBytes, "UTF-8")>
|
|
||||||
<cfcatch>
|
|
||||||
<!--- fallback: читаем через буфер --->
|
|
||||||
<cfset baos = createObject("java", "java.io.ByteArrayOutputStream").init()>
|
|
||||||
<cfloop condition="true">
|
|
||||||
<cfset b = zis.read()>
|
|
||||||
<cfif b LT 0><cfbreak></cfif>
|
|
||||||
<cfset baos.write(b)>
|
|
||||||
</cfloop>
|
|
||||||
<cfset xmlStr = createObject("java", "java.lang.String").init(baos.toByteArray(), "UTF-8")>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
<cfbreak>
|
|
||||||
</cfif>
|
</cfif>
|
||||||
<cfset zis.closeEntry()>
|
<cfset var entryBytes = "">
|
||||||
</cfloop>
|
|
||||||
<cfset zis.close()>
|
|
||||||
<cfset bais.close()>
|
|
||||||
|
|
||||||
<cfif NOT len(xmlStr)>
|
|
||||||
<cfset arrayAppend(errors, "DOCX: word/document.xml not found in ZIP")>
|
|
||||||
<cfelse>
|
|
||||||
<cfset docXml = xmlParse(xmlStr)>
|
|
||||||
<cfset ns = "http://schemas.openxmlformats.org/wordprocessingml/2006/main">
|
|
||||||
|
|
||||||
<!--- Ищем body: или с namespace или без --->
|
|
||||||
<cfset body = "">
|
|
||||||
<cftry>
|
<cftry>
|
||||||
<cfset body = xmlSearch(docXml, "//:body")>
|
<cfset entryBytes = zzis.readAllBytes()>
|
||||||
<cfcatch>
|
<cfcatch>
|
||||||
<cfset body = xmlSearch(docXml, "//*[local-name()='body']")>
|
<cfset var zbaos = createObject("java", "java.io.ByteArrayOutputStream").init()>
|
||||||
|
<cfloop condition="true">
|
||||||
|
<cfset var zb = zzis.read()>
|
||||||
|
<cfif zb LT 0><cfbreak></cfif>
|
||||||
|
<cfset zbaos.write(zb)>
|
||||||
|
</cfloop>
|
||||||
|
<cfset entryBytes = zbaos.toByteArray()>
|
||||||
</cfcatch>
|
</cfcatch>
|
||||||
</cftry>
|
</cftry>
|
||||||
|
<cfset var zext = listLast(zname, ".")>
|
||||||
<cfif arrayLen(body) GT 0>
|
<cfset var parsed = {elements: [], errors: []}>
|
||||||
<cfset body = body[1]>
|
<cfif zext EQ "pdf">
|
||||||
<cfloop array="#body.XmlChildren#" index="child">
|
<cfset parsed = parsePDF(entryBytes)>
|
||||||
<cfset localName = child.XmlName>
|
<cfelseif zext EQ "docx">
|
||||||
<cfif localName EQ "p" OR right(localName, 2) EQ ":p">
|
<cfset parsed = parseDOCX(entryBytes)>
|
||||||
<!--- Параграф: собираем текст из всех w:t --->
|
|
||||||
<cfset paraText = "">
|
|
||||||
<cftry>
|
|
||||||
<cfset textNodes = xmlSearch(child, "//:t")>
|
|
||||||
<cfcatch>
|
|
||||||
<cfset textNodes = xmlSearch(child, "//*[local-name()='t']")>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
<cfloop array="#textNodes#" index="tn">
|
|
||||||
<cfset paraText &= tn.XmlText>
|
|
||||||
</cfloop>
|
|
||||||
<cfset paraText = trim(paraText)>
|
|
||||||
<cfif len(paraText)>
|
|
||||||
<cfset arrayAppend(elements, {type: "paragraph", style: "", text: paraText, page: 0})>
|
|
||||||
</cfif>
|
|
||||||
<cfelseif localName EQ "tbl" OR right(localName, 4) EQ ":tbl">
|
|
||||||
<!--- Таблица --->
|
|
||||||
<cfset rows = []>
|
|
||||||
<cftry>
|
|
||||||
<cfset trNodes = xmlSearch(child, "//:tr")>
|
|
||||||
<cfcatch>
|
|
||||||
<cfset trNodes = xmlSearch(child, "//*[local-name()='tr']")>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
<cfloop array="#trNodes#" index="trNode">
|
|
||||||
<cfset row = []>
|
|
||||||
<cftry>
|
|
||||||
<cfset tcNodes = xmlSearch(trNode, ".//:tc")>
|
|
||||||
<cfcatch>
|
|
||||||
<cfset tcNodes = xmlSearch(trNode, ".//*[local-name()='tc']")>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
<cfloop array="#tcNodes#" index="tcNode">
|
|
||||||
<cfset cellText = "">
|
|
||||||
<cftry>
|
|
||||||
<cfset tNodes = xmlSearch(tcNode, ".//:t")>
|
|
||||||
<cfcatch>
|
|
||||||
<cfset tNodes = xmlSearch(tcNode, ".//*[local-name()='t']")>
|
|
||||||
</cfcatch>
|
|
||||||
</cftry>
|
|
||||||
<cfloop array="#tNodes#" index="tNode">
|
|
||||||
<cfset cellText &= tNode.XmlText>
|
|
||||||
</cfloop>
|
|
||||||
<cfset arrayAppend(row, trim(cellText))>
|
|
||||||
</cfloop>
|
|
||||||
<cfif arrayLen(row) GT 0>
|
|
||||||
<cfset arrayAppend(rows, row)>
|
|
||||||
</cfif>
|
|
||||||
</cfloop>
|
|
||||||
<cfif arrayLen(rows) GT 0>
|
|
||||||
<cfset arrayAppend(elements, {type: "table", rows: rows, page: 0})>
|
|
||||||
</cfif>
|
|
||||||
</cfif>
|
|
||||||
</cfloop>
|
|
||||||
<cfelse>
|
<cfelse>
|
||||||
<cfset arrayAppend(errors, "DOCX: body not found in document.xml")>
|
<cfset arrayAppend(parsed.errors, "unsupported: .#zext#")>
|
||||||
</cfif>
|
</cfif>
|
||||||
</cfif>
|
<cfset var prefix = doc.filename & "/">
|
||||||
|
<cfloop array="#parsed.elements#" index="var el">
|
||||||
|
<cfset el.archive_path = prefix & zname>
|
||||||
|
<cfset arrayAppend(elements, el)>
|
||||||
|
</cfloop>
|
||||||
|
<cfset arrayAppend(files, {
|
||||||
|
filename: zname, archive_path: prefix & zname,
|
||||||
|
element_count: arrayLen(parsed.elements),
|
||||||
|
error_count: arrayLen(parsed.errors)
|
||||||
|
})>
|
||||||
|
<cfloop array="#parsed.errors#" index="var e">
|
||||||
|
<cfset arrayAppend(errors, zname & ": " & e)>
|
||||||
|
</cfloop>
|
||||||
|
<cfset zzis.closeEntry()>
|
||||||
|
</cfloop>
|
||||||
|
<cfset zzis.close()><cfset zbais.close()>
|
||||||
<cfcatch>
|
<cfcatch>
|
||||||
<cfset arrayAppend(errors, "DOCX: " & cfcatch.message)>
|
<cfset arrayAppend(errors, "ZIP: " & cfcatch.message)>
|
||||||
</cfcatch>
|
</cfcatch>
|
||||||
</cftry>
|
</cftry>
|
||||||
|
|
||||||
<!--- .doc — старый формат, пропускаем --->
|
<cfelseif doc.mime_type EQ "application/pdf">
|
||||||
<cfelseif doc.mime_type EQ "application/msword">
|
<cfset var fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
||||||
<cfset arrayAppend(errors, ".doc parsing not available (use libreoffice to convert)")>
|
<cfset var parsed = parsePDF(fileBytes)>
|
||||||
|
<cfset elements = parsed.elements>
|
||||||
|
<cfset errors = parsed.errors>
|
||||||
|
|
||||||
|
<cfelseif doc.mime_type EQ "application/vnd.openxmlformats-officedocument.wordprocessingml.document">
|
||||||
|
<cfset var fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
||||||
|
<cfset var parsed = parseDOCX(fileBytes)>
|
||||||
|
<cfset elements = parsed.elements>
|
||||||
|
<cfset errors = parsed.errors>
|
||||||
|
|
||||||
<!--- TXT — plain text --->
|
|
||||||
<cfelseif doc.mime_type EQ "text/plain" OR doc.mime_type EQ "application/octet-stream">
|
<cfelseif doc.mime_type EQ "text/plain" OR doc.mime_type EQ "application/octet-stream">
|
||||||
<cftry>
|
<cftry>
|
||||||
<cfset fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
<cfset var fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
||||||
<cfset text = createObject("java", "java.lang.String").init(fileBytes, "UTF-8")>
|
<cfset var text = createObject("java", "java.lang.String").init(fileBytes, "UTF-8")>
|
||||||
<cfloop list="#text#" index="line" delimiters="#chr(10)#">
|
<cfloop list="#text#" index="var line" delimiters="#chr(10)#">
|
||||||
<cfset line = trim(line)>
|
<cfset line = trim(line)>
|
||||||
<cfif len(line)>
|
<cfif len(line)>
|
||||||
<cfset arrayAppend(elements, {type: "paragraph", style: "", text: line, page: 1})>
|
<cfset arrayAppend(elements, {type: "paragraph", style: "", text: line, page: 1})>
|
||||||
@@ -209,16 +263,16 @@
|
|||||||
</cfcatch>
|
</cfcatch>
|
||||||
</cftry>
|
</cftry>
|
||||||
|
|
||||||
|
<cfelseif doc.mime_type EQ "application/msword">
|
||||||
|
<cfset arrayAppend(errors, ".doc not supported (use libreoffice)")>
|
||||||
<cfelse>
|
<cfelse>
|
||||||
<cfset arrayAppend(errors, "unsupported mime_type: " & doc.mime_type)>
|
<cfset arrayAppend(errors, "unsupported: " & doc.mime_type)>
|
||||||
</cfif>
|
</cfif>
|
||||||
|
|
||||||
<!--- Сохраняем результат --->
|
<cfset var newStatus = arrayLen(elements) GT 0 ? "parsed" : "error">
|
||||||
<cfset newStatus = arrayLen(elements) GT 0 ? "parsed" : "error">
|
|
||||||
<cfif arrayLen(errors) GT 0 AND arrayLen(elements) EQ 0>
|
<cfif arrayLen(errors) GT 0 AND arrayLen(elements) EQ 0>
|
||||||
<cfset newStatus = "error">
|
<cfset newStatus = "error">
|
||||||
</cfif>
|
</cfif>
|
||||||
|
|
||||||
<cfquery datasource="baza">
|
<cfquery datasource="baza">
|
||||||
UPDATE documents
|
UPDATE documents
|
||||||
SET elements_json = <cfqueryparam value="#serializeJSON(elements)#" cfsqltype="cf_sql_varchar">::jsonb,
|
SET elements_json = <cfqueryparam value="#serializeJSON(elements)#" cfsqltype="cf_sql_varchar">::jsonb,
|
||||||
@@ -226,23 +280,14 @@
|
|||||||
error_message = <cfqueryparam value="#arrayLen(errors) ? serializeJSON(errors) : ''#" cfsqltype="cf_sql_varchar">
|
error_message = <cfqueryparam value="#arrayLen(errors) ? serializeJSON(errors) : ''#" cfsqltype="cf_sql_varchar">
|
||||||
WHERE id = <cfqueryparam value="#url.doc_id#" cfsqltype="cf_sql_varchar">
|
WHERE id = <cfqueryparam value="#url.doc_id#" cfsqltype="cf_sql_varchar">
|
||||||
</cfquery>
|
</cfquery>
|
||||||
|
<cfset result = {ok: true, doc_id: url.doc_id, filename: doc.filename,
|
||||||
<cfset result = {
|
mime_type: doc.mime_type, status: newStatus,
|
||||||
ok: true,
|
element_count: arrayLen(elements), error_count: arrayLen(errors),
|
||||||
doc_id: url.doc_id,
|
files: files}>
|
||||||
filename: doc.filename,
|
|
||||||
mime_type: doc.mime_type,
|
|
||||||
status: newStatus,
|
|
||||||
element_count: arrayLen(elements),
|
|
||||||
page_count: isDefined("pageCount") ? pageCount : 0,
|
|
||||||
errors: errors
|
|
||||||
}>
|
|
||||||
</cfif>
|
</cfif>
|
||||||
</cfif>
|
</cfif>
|
||||||
|
|
||||||
<cfcatch>
|
<cfcatch>
|
||||||
<cfset result = {ok: false, error: cfcatch.message, detail: cfcatch.detail}>
|
<cfset result = {ok: false, error: cfcatch.message, detail: cfcatch.detail}>
|
||||||
</cfcatch>
|
</cfcatch>
|
||||||
</cftry>
|
</cftry>
|
||||||
|
|
||||||
<cfoutput>#serializeJSON(result)#</cfoutput>
|
<cfoutput>#serializeJSON(result)#</cfoutput>
|
||||||
|
|||||||
Reference in New Issue
Block a user