v1.0.42: конвертация .doc через ВМ + парсер .doc
This commit is contained in:
@@ -61,7 +61,7 @@
|
||||
<body>
|
||||
<div class="topbar">
|
||||
<img src="/nubes-logo.svg" alt="Nubes">
|
||||
<span class="title">Сверка договоров — LLM <span style="font-weight:400;color:var(--muted);font-size:12px;">v1.0.41 — Lucee</span></span>
|
||||
<span class="title">Сверка договоров — LLM <span style="font-weight:400;color:var(--muted);font-size:12px;">v1.0.42 — Lucee</span></span>
|
||||
</div>
|
||||
|
||||
<div class="content">
|
||||
@@ -140,6 +140,7 @@
|
||||
lucide.createIcons();
|
||||
|
||||
var UPLOAD_URL = 'https://contracts.kube5s.ru/lucee/upload.cfm';
|
||||
var CONVERT_URL = 'https://contracts.kube5s.ru/convert-doc';
|
||||
var SITE_URL = ''; // same origin for api calls
|
||||
|
||||
var fileInput = document.getElementById('fileInput');
|
||||
@@ -227,26 +228,51 @@ fileInput.addEventListener('change', async function() {
|
||||
|
||||
function uploadFile(file, onProgress) {
|
||||
return new Promise(function(resolve, reject) {
|
||||
var xhr = new XMLHttpRequest();
|
||||
var fd = new FormData();
|
||||
fd.append('files', file);
|
||||
if (contractId) fd.append('contract_id', contractId);
|
||||
// .doc → конвертация в docx
|
||||
var isDoc = file.name.toLowerCase().endsWith('.doc') && !file.name.toLowerCase().endsWith('.docx');
|
||||
var uploadFile = file;
|
||||
var uploadName = file.name;
|
||||
|
||||
xhr.open('POST', UPLOAD_URL);
|
||||
xhr.upload.onprogress = function(e) {
|
||||
if (e.lengthComputable && onProgress) onProgress(Math.round(e.loaded / e.total * 100));
|
||||
};
|
||||
xhr.onload = function() {
|
||||
try {
|
||||
var r = JSON.parse(xhr.responseText);
|
||||
if (r.OK) resolve(r);
|
||||
else reject(new Error(r.ERROR || 'Неизвестная ошибка'));
|
||||
} catch(e) { reject(new Error('Некорректный ответ')); }
|
||||
};
|
||||
xhr.onerror = function() { reject(new Error('Сеть')); };
|
||||
xhr.ontimeout = function() { reject(new Error('Таймаут')); };
|
||||
xhr.timeout = 180000;
|
||||
xhr.send(fd);
|
||||
function doUpload() {
|
||||
var xhr = new XMLHttpRequest();
|
||||
var fd = new FormData();
|
||||
fd.append('files', uploadFile, uploadName);
|
||||
if (contractId) fd.append('contract_id', contractId);
|
||||
xhr.open('POST', UPLOAD_URL);
|
||||
xhr.upload.onprogress = function(e) {
|
||||
if (e.lengthComputable && onProgress) onProgress(Math.round(e.loaded / e.total * 100));
|
||||
};
|
||||
xhr.onload = function() {
|
||||
try {
|
||||
var r = JSON.parse(xhr.responseText);
|
||||
if (r.OK) resolve(r);
|
||||
else reject(new Error(r.ERROR || 'Неизвестная ошибка'));
|
||||
} catch(e) { reject(new Error('Некорректный ответ')); }
|
||||
};
|
||||
xhr.onerror = function() { reject(new Error('Сеть')); };
|
||||
xhr.ontimeout = function() { reject(new Error('Таймаут')); };
|
||||
xhr.timeout = 180000;
|
||||
xhr.send(fd);
|
||||
}
|
||||
|
||||
if (isDoc) {
|
||||
var xhr = new XMLHttpRequest();
|
||||
xhr.open('POST', CONVERT_URL);
|
||||
xhr.responseType = 'blob';
|
||||
xhr.onload = function() {
|
||||
if (xhr.status === 200 && xhr.response.size > 100) {
|
||||
uploadFile = xhr.response;
|
||||
uploadName = file.name.replace(/\.doc$/i, '.docx');
|
||||
doUpload();
|
||||
} else {
|
||||
reject(new Error('Конвертация .doc'));
|
||||
}
|
||||
};
|
||||
xhr.onerror = function() { reject(new Error('Конвертер')); };
|
||||
xhr.send(file);
|
||||
} else {
|
||||
doUpload();
|
||||
}
|
||||
});
|
||||
}
|
||||
|
||||
|
||||
+27
-2
@@ -163,6 +163,28 @@
|
||||
<cfreturn out>
|
||||
</cffunction>
|
||||
|
||||
<!--- ═══════════════════════════════════════════════════════════
|
||||
Helper: parseDOC — грубый экстрактор текста из .doc
|
||||
═══════════════════════════════════════════════════════════ --->
|
||||
<cffunction name="parseDOC" access="private" returntype="struct">
|
||||
<cfargument name="fileBytes" type="binary">
|
||||
<cfset var out = {elements: [], errors: []}>
|
||||
<cftry>
|
||||
<cfset var raw = createObject("java", "java.lang.String").init(fileBytes, "windows-1251")>
|
||||
<cfset var lines = raw.split("\n")>
|
||||
<cfloop array="#lines#" index="var line">
|
||||
<cfset line = trim(line)>
|
||||
<cfif len(line) GT 3 AND (reFind("[а-яА-ЯёЁ]", line) OR reFind("\d{2,}", line))>
|
||||
<cfset arrayAppend(out.elements, {type: "paragraph", style: "", text: line, page: 0})>
|
||||
</cfif>
|
||||
</cfloop>
|
||||
<cfcatch>
|
||||
<cfset arrayAppend(out.errors, ".doc: " & cfcatch.message)>
|
||||
</cfcatch>
|
||||
</cftry>
|
||||
<cfreturn out>
|
||||
</cffunction>
|
||||
|
||||
<!--- ═══════════════════════════════════════════════ MAIN --->
|
||||
<cfset result = {ok: false, error: ""}>
|
||||
<cftry>
|
||||
@@ -210,7 +232,7 @@
|
||||
<cfset parsed = {elements: [], errors: []}>
|
||||
<cfif zext EQ "pdf">
|
||||
<cfset parsed = parsePDF(entryBytes)>
|
||||
<cfelseif zext EQ "docx">
|
||||
<cfelseif zext EQ "docx" OR zext EQ "doc">
|
||||
<cfset parsed = parseDOCX(entryBytes)>
|
||||
<cfelse>
|
||||
<cfset arrayAppend(parsed.errors, "unsupported: .#zext#")>
|
||||
@@ -264,7 +286,10 @@
|
||||
</cftry>
|
||||
|
||||
<cfelseif doc.mime_type EQ "application/msword">
|
||||
<cfset arrayAppend(errors, ".doc not supported (use libreoffice)")>
|
||||
<cfset fileBytes = binaryDecode(doc.original_bytes, "base64")>
|
||||
<cfset parsed = parseDOC(fileBytes)>
|
||||
<cfset elements = parsed.elements>
|
||||
<cfset errors = parsed.errors>
|
||||
<cfelse>
|
||||
<cfset arrayAppend(errors, "unsupported: " & doc.mime_type)>
|
||||
</cfif>
|
||||
|
||||
Reference in New Issue
Block a user