Форум программистов, компьютерный форум, киберфорум
ИИ, нейросети, LLM, ML, Data Science, ИИ-агенты
Войти
Регистрация
Восстановить пароль
Блоги Сообщество Поиск  
 
 
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3

Как заставить офлайн модели не выдумывать?

08.06.2026, 09:24. Показов 1533. Ответов 37
Метки нет (Все метки)

Студворк — интернет-сервис помощи студентам
Доброго!
Использую офлайн модели для сравнения документов. Но блин, они постоянно придумывают или додумывают значения.
В системном промте строго запрещаю это, температура на минимуме, но один раз проверят хорошо, второй придумывает)

Перепробовал уже штук 30 моделей, сейчас пока остановился "qwen/qwen3.6-27b", это пока луче остального, но все равно не стабильно.
0
Programming
Эксперт
39485 / 9562 / 3019
Регистрация: 12.04.2006
Сообщений: 41,671
Блог
08.06.2026, 09:24
Ответы с готовыми решениями:

Программа для офлайн преобразования на винде русской речи в текст в любой программе
Всех приветствую. Есть ли какие то офлайн программы кроме speechpulse(https://speechpulse.com), для...

Как правильно выложить в общий доступ исходник модели памяти
Собственно сам исходник, лежит на GitHab. Что-то подобное выкладываю первый раз, и хотелось бы...

Чем отличается обучение модели Гроссберга-Карпентера от обучения многослойного перцептрона
Чем принципиально отличается обучение модели Гроссберга-Карпентера от обучения многослойного...

37
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
08.06.2026, 15:31
Студворк — интернет-сервис помощи студентам
В моей специфической задаче добавления документов в БД:
1. PDF тоже в картинки -> OCR -> JSON -> (проверка данных полей справочников БД с помощью RAG, коррекция данных JSON) -> stored procedure MariaDB. Тут основной экшн сравнения. Если "новый" - пишет данные в БД + исходники на диск в архиве, если уже имеется, сообщает об этом.
2. Пользую n8n автоматизацию, ollama с qwen3.5 35B-A3B-Q4 (пробую переползти на qwen3.6:35b-a3b-mtp-q4_K_M, он быстрее).
3. Железо описал в профиле.

Под типами я имел в виду разновидности документов, а не их форматов).

У меня тоже сложность в том, что "однотипные" пакеты документов поступают в различных сочетаниях расширений файлов. Приходится ветвить обработку для каждого сочетания расширений.
0
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
08.06.2026, 15:41  [ТС]
Jamaica, а как Вы пришли к qwen3.5 35B-A3B-Q4, смотрю она не свеженькая?
И как понял вы используете на кастумную сборку, а от сообщества?
Посмотрел Ваше железо. с разверткой агента не было проблем, то он весит 22ГБ, а у Вас 32Гб оперативы (или настраивали честь на видео, часть на оперетивную память)?
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
08.06.2026, 15:56
Цитата Сообщение от Dinkin Посмотреть сообщение
а как Вы пришли к qwen3.5 35B-A3B-Q4, смотрю она не свеженькая?
"Родная" от ollama. Название "вручную" написал, просто что бы параметры указать.

Начинал еще с qwen3.0 с аналогичными параметрами, затем вышла 3.5, перешел на нее,
хоть и любит порассуждать без толку, но OCR рукописного заметно лучше. (опять же "на глаз").
Сейчас в тестовом режиме qwen3.6:35b-a3b-mtp-q4_K_M на 30 релизе ollama,
mtp скорость заметно поднял, но, по ощущениям, эмбединговая модель медленнее работает.
Цитата Сообщение от Dinkin Посмотреть сообщение
а у Вас 32Гб оперативы
Оперативы 2*32=64. VRAM 2*16=32.
Все в GPU.
И да, это потроха описаны не рабочей win машины, это выделенный под задачу home lab "сервер".
Все сервисы в докер контейнерах.
0
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
08.06.2026, 15:58  [ТС]
Jamaica, а кроме ollama тестировали к примеру LM Studio? или с ollama начали, она устроила, так и продолжили?
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
08.06.2026, 16:07
Пробовал кучу других локальных моделей,
но скорость MoE архитектуры с Q4 квантованием да + MTP =
неплохой компромисс под мои (не очень обременительные в смысле объемов) задачи
и финансовые возможности в покупке железа.

Добавлено через 4 минуты
Цитата Сообщение от Dinkin Посмотреть сообщение
тестировали к примеру LM Studio
Тестировал с год назад на рабочей машине win10 с RTX 1060 (6Gb VRAM).
Буквально неделю-две как назад, щупал llama.cpp в варианте llama-server.
Понравилось. И ui удобный для чата.
1
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
08.06.2026, 16:07  [ТС]
Понятно, спасибо за консультацию.
Я попробую Ваш агент тоже потестировать, если он конечно у меня развернётся (у меня 64 операритвы и 24 гпу). Но боюсь что не потянет. Если потянет и он справится, от меня "рекомендацьюн".
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
08.06.2026, 16:35
Цитата Сообщение от Dinkin Посмотреть сообщение
если он конечно у меня развернётся
Полагаю не с разбега.
У меня:
qwen3.5:35b-a3b = 13,5+13,2 GB VRAM на ollama 0.17.4

qwen3.6:35b-a3b-mtp-q4_K_M = 12,8 + 14,8 VRAM

Возможно, llama-server с разгрузкой слоев на CPU, квантованием кеша и другими хитростями.

Цитата Сообщение от Dinkin Посмотреть сообщение
спасибо
Не на чем.

Добавлено через 4 минуты
Или такой вариант попробовать?
У меня:
qwen3.6:27b-mtp-q4_K_M под ollama = 10,4 + 13,3 VRAM (16к окно контекста)
простой текст 34-47 t/s
На Смешанном (текст + html + css + js) 49 t/s
1
820 / 579 / 75
Регистрация: 20.09.2014
Сообщений: 3,820
10.06.2026, 03:38
Цитата Сообщение от MallSerg Посмотреть сообщение
Конечно условно правильные ответы более "статистически" вероятны но не всегда.
Но вы же сами сейчас предположили статистически, даже не статистически, а просто с потолка, что проблема именно в ЭТОМ, а НИ В ЧЁМ ДРУГОМ и ещё очень уверенно это загоняете.) Вы сами ещё тот статистический анализатор со своими тараканами. Нормальный статистический анализатор работает качественнее.

Добавлено через 7 минут
Вам нужно немного изменить отношение к LLM. Они предсказывают следующий токен, оперируя в 10000-мерном пространстве, тогда как человек работает со 10-мерным пространством, но просто доступ к информации у LLM ограниченный: человек ощущает своими 6-7 чувствами, а LLM видит только текст или картинки.
0
 Аватар для Firewall_Father
1 / 1 / 0
Регистрация: 10.06.2026
Сообщений: 3
10.06.2026, 15:35
Попробуйте подход: извлечение данных в структурированный JSON с помощью модели и последующее сравнение на стороне кода (JS/Python). Это повысит точность и исключит "фантазии" ИИ при сравнении
как вариант
1
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
10.06.2026, 16:07  [ТС]
Firewall_Father, Я думал об этом, но проблема когда к примеру в документе есть адрес чего либо, в другом тоже он есть, но очередность в нем другая, но все тоже самое....тут надо семантически сравнивать (
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
10.06.2026, 16:26
Цитата Сообщение от Dinkin Посмотреть сообщение
есть адрес чего либо, в другом тоже он есть, но очередность в нем другая
Что значит "очередность"?
Несколько адресов в документе?
0
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
10.06.2026, 16:38  [ТС]
Jamaica, как то так "Улица Иванова, дом 45, город Иваново" VS "г.Иваново ул.Иванова(45)"

Добавлено через 1 минуту
Я уже не знаю, может отказаться от связки LM Studio и агентов. Когда начинаю тестировать и пишу задачи в чат, все отлично. Когда пишу задачи через API, такая херня. На форуме студии вычитал, что запросы через API и в чате внутри системы обрабатываются по разному.
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
10.06.2026, 16:47
Оба варианта llm-ка должна легко приводить к json описанию,
разместив нужные наименования по правильным атрибутам (город/улица).

Добавлено через 3 минуты
Конечно, стоит ей "подсказать" в промпте наиболее часто встречающиеся сокращения (г., ул., д. и т.п.)
0
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
10.06.2026, 17:18  [ТС]
Jamaica, Верно, но тогда у меня пользовательский промт будет километровый (для каждого чиха корректировки), не знаю приемлемо ли это =)
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
10.06.2026, 17:31
Цитата Сообщение от Dinkin Посмотреть сообщение
промт будет километровый
Промпты llm-ки читают быстро, если запущены без драфта.

Опять же можно пробовать в два прохода,
сначала взять описание адреса "как есть",
вторым проходом "раскидать по полочкам".

Надо будет "поиграться".
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
11.06.2026, 12:40
Немного поигрался по теме сравнения адресов с qwen3.6:35b-a3b-mtp-q4_K_M с включенной рассуждалкой.

Цитата Сообщение от Jamaica Посмотреть сообщение
Конечно, стоит ей "подсказать" в промпте наиболее часто встречающиеся сокращения (г., ул., д. и т.п.)
Это оказалось излишне, вполне себе понимает.
А вот то, что запись углового дома может быть двойной через слэш пришлось подсказать.

Прогонял JPG-и с табличками по 12-20 пар адресов в каждой.
Два столбца с описанием одних и тех-же адресов в разных справочных системах.

Выявилось следующее:
1. При распознавании JPG-ов низкого качества попадаются ошибки распознавания текста,
причем разные, при разных прогонах.
2. Проявились разночтения одних и тех-же значений при форматировании вывода на разных прогонах.
Пропуск пробелов, замена пробелов символами "/n" из маркдаун.
С этим, в принципе, llm-ка при сравнении разобралась сама.
3. Нечастые (но имеются) разногласия сравнения адресов при:
- указании в промпте обосновать результат сравнения (точнее).
- без указания обоснования.
4. Результаты "пакетного" сравнения более точные, чем результаты построчного сравнения двух адресов.
- При пакетном сравнении у модельки больше контекста и она "видит шире", и не слишком "лезет" в подробности.
- при построчном сравнении двух адресов модельке "скучно" и она начинает "цепляться к каждой запятой",
и результаты сравнения сильно хуже.
5. Очень неплохо раскладывает адреса по составным частям.

Как-то так.
1
 Аватар для Dinkin
783 / 556 / 136
Регистрация: 31.05.2013
Сообщений: 3,182
Записей в блоге: 3
11.06.2026, 17:20  [ТС]
Jamaica, Из Вашего теста, я сделал выводы:
1) Если есть возможность парсить pdf, то это в приоритете чем делать из него нарезку jpg.
2) То что ИИ-хе луче давать больше информации, ей так проще орентироваться.

Ну а Вы же задействуете одновременно и системный промт и пользовательский или что то одно?
0
1333 / 551 / 112
Регистрация: 29.03.2016
Сообщений: 1,355
11.06.2026, 17:54
Цитата Сообщение от Dinkin Посмотреть сообщение
1)
Если pdf -ка содержит описательный текст - лучше pdf.
Если скан обернут в pdf - тут без вариантов.

В случае наличия таблиц, надо пробовать.
Особенно если надо извлекать не чохом, а:
возьми значение из первой строки таблицы первый столбец,
и из последней строки таблицы такой-то столбец.

Цитата Сообщение от Dinkin Посмотреть сообщение
Вы же задействуете одновременно и системный промт и пользовательский
Когда не забываю, пользую оба.
зы: Когда "балуюсь", чаще забываю поменять системный.

Цитата Сообщение от Dinkin Посмотреть сообщение
2)
Да.
Раньше, на модельке версии 3.0, приходилось примеры/валидные значения в промпт активно подсовывать.
С выходом "рассуждалки" версии 3.5 стало проще, но совсем не отказываюсь от этого,
модель меньше рассуждает "что есть что", быстрее выдает ответ.

Добавлено через 6 минут
Если появляется регулярный бланк для распознавания (в основном с рукописным заполнением),
прошу модель распознать и рассказать, что вызвало затруднения.
Бывает, с тем-же иду к большой облачной модели.
Затем сравниваю ответы, что-то отвергаю, к чему-то прислушиваюсь,
ну и проверяю на качество и скорость ответов.
1
Надоела реклама? Зарегистрируйтесь и она исчезнет полностью.
inter-admin
Эксперт
29715 / 6470 / 2152
Регистрация: 06.03.2009
Сообщений: 28,500
Блог
11.06.2026, 17:54

Моделирование ИНС
Здравствуйте, я много прочитал про ИНС и хочу уточнить непонятные мне моменты. Входные сигналы...

Модель мира
Дано ограниченное пространство-материя, допустим двумерное, есть некий закон движения и возможно...

Можно ли распознавать с использованием 3D моделей?
Здравствуйте. Подскажите, как можно распознавать объекты на фотоснимке с использованием 3D моделей?

Какая программа подойдет для моделирования нейронной цепи?
Какая программа лучше всего подойдет для моделирования нейронной цепи и движения сигнала по ней ?

Рефлексный агент, основный на модели
Есть такая среда моделирования "Vacuum Cleaner World". Может кто то слышал о ней. Это...


Искать еще темы с ответами

Или воспользуйтесь поиском по форуму:
38
Ответ Создать тему
Новые блоги и статьи
Часы электронные
Uhbif79 12.08.2026
Выкладываю программу часов. Программа позволяет: 1. Использовать системное время и дату, 2. Есть возможность вводить время и дату вручную. 3. Реализованы 2 будильника: начало и конец рабочего дня. . . .
Часы с будильником на основе класса QLCDNumber
Uhbif79 12.08.2026
Всем добрый день, выкладываю программу часов с будильником на основе класса QLCDNumber. Здесь я пробовал самостоятельно создавал классы, впервые столкнулся с видимостью переменной одного класса из. . .
Установка MinGW GCC 16.2 и CMake
8Observer8 10.08.2026
VK Видео: https:/ / vkvideo. ru/ video-240781534_456239017 YouTube: eY5-5PyI9NM Текстовая версия
Неделя из жизни имитационной модели склада: мои кривые руки растут, откуда надо
anaschu 10.08.2026
Неделя из жизни имитационной модели склада: как я почти написал неправильную логику и что с этим делать Работаю сейчас над учебно-рабочим проектом: строю в AnyLogic имитационную модель процессов. . .
Калькулятор для расчета родства
russiannick 07.08.2026
1. Задача: Создать калькулятор для расчета родства. Родственных связей существует 8 ступеней, такие как: p - отец P - мать q - муж Q - жена b - брат B - сестра s - сын S - дочь
Мир по моей воле
kumehtar 07.08.2026
Когда-то кажется, что всё просто. Ты весь такой светлый. Причиняешь добро. Борешься за справедливость в этом тёмном мире. Потом начинаешь замечать одну неприятную вещь. Почти каждый хороший. . .
Кредитный калькулятор
Maks 05.08.2026
Решение задачи по прикладной информатике средствами 1С. Задача: Напишите приложение-калькулятор, которое помогает рассчитывать параметры кредита для аннуитетного и дифференцированного видов. . .
У нас сейчас поговорку "Опять 25" нужно переделать на "Опять +35".
kumehtar 04.08.2026
С ностальгией вспоминаю времена моего детства, когда у нас и правда +25 - была максимальная температура летом. Раньше +25 °C реально казались вершиной жары, когда можно было весь день пропадать на. . .
КиберФорум - форум программистов, компьютерный форум, программирование
Powered by vBulletin
Copyright ©2000 - 2026, CyberForum.ru