Форум программистов, компьютерный форум, киберфорум
Konst2016
Войти
Регистрация
Восстановить пароль
Блоги Сообщество Поиск  

Как находил близкие слова из статьи - word2vec (пакет gensim, anaconda)

Запись от Konst2016 размещена 23.07.2021 в 21:54
Показов 2210 Комментарии 0
Метки ai, gensim, nlp, python, ии

Привет всем)
Что такое анаконда по моему мнению?
Это более удобный Питон, мы можем ее использовать и как анаконду и как Питон.
Инсталятор анаконды гарантирует что C(или Fortran) модули уже на сайте скомпилированы и мы их загружем.
Питон инсталятор pip не гарантирует это, иногда надо компилировать(трудновато ).
Также следит за версиями пакетов(из их метадат)на соответствие например Питону внутри окруженя(хотя я вручную удалял некоторые и загружал соответствующие
данной версии Питон не указывая версии)
Вообще использует изолированные среды.
(как я пробовал устанавливать переменные среды пас для анаконда можно по https://vk.com/net_search)
Итак cmd VS Code Ide:
>conda activate.bat
>conda create -n myenv python=3.8 (для вин 7)
>cd ./myenv
>conda install beatifulsoup4 (будут соответсвенно Питону 3.8 загружаться)
>conda install lxml (для beatifulsoup4)
>conda install re
>conda install Cython (для gesim)
>conda install gensim (word2vec)
>conda install nltk (обработка естественного языка)
>python -m nltk.downloader punkt:=<потом как параметр stopwords> (какие-то pickle файлы для nltk идут в С:/Users/<user>/AppData/Roaming/nltk_data)
Код из статьи Usman Malik по https://pythobyte.com/implemen... hon-99811/.
Получает код на англ. языке по инету из википедии про искусственный интелект и находит слова близкие к нему:
Python
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
import bs4 as bs
import urllib.request
import nltk
from nltk.corpus import stopwords
from gensim.models import Word2Vec
import re
 
scrapped_data = urllib.request.urlopen('https://en.wikipedia.org/wiki/Artificial_intelligence')
article = scrapped_data .read()
 
parsed_article = bs.BeautifulSoup(article,'lxml')
 
paragraphs = parsed_article.find_all('p')
 
article_text = ""
 
for p in paragraphs:
    article_text += p.text
 
# Cleaing the text
processed_article = article_text.lower()
processed_article = re.sub('[^a-zA-Z]', ' ', processed_article )
processed_article = re.sub(r'\s+', ' ', processed_article)
 
# Preparing the dataset
all_sentences = nltk.sent_tokenize(processed_article)
 
all_words = [nltk.word_tokenize(sent) for sent in all_sentences]
 
# Removing Stop Words
 
len_all_words=len(all_words)
for i in range(len_all_words):
    all_words[i] = [w for w in all_words[i] if w not in stopwords.words('english')]   
 
word2vec = Word2Vec(all_words, min_count=2)
 
sim_words = word2vec.wv.most_similar('intelligence')
 
print('similar:\n',sim_words)
Bash
1
2
3
Out:
similar:
 [('domains', 0.3882658779621124), ('ai', 0.3679261803627014), ('better', 0.3447827100753784), ('work', 0.34445908665657043), ('may', 0.31940072774887085), ('field', 0.314007967710495), ('intelligent', 0.30112627148628235), ('ethics', 0.29427751898765564), ('would', 0.29421427845954895), ('robotics', 0.29368504881858826)]
Метки ai, gensim, nlp, python, ии
Размещено в Без категории
Надоела реклама? Зарегистрируйтесь и она исчезнет полностью.
Всего комментариев 0
Комментарии
 
Новые блоги и статьи
Программный домашний кинотеатр
russiannick 27.09.2026
Сподобился на программный домашний кинотеатр. В качестве ЯВУ по традиции выбрал js. В помощники взял Яндекс-Алису. Было создано три зала на разные интересы. исторические и ретро сериал Хичкок. . .
Беседа с ИИ о программистах, недопускающих к созданию и правке кода генеративные ИИ и причины этого
zorxor 21.09.2026
Раньше я радовался или получал некоторые эмоции, пусть небольшие, но всё же, от самого процесса написания кода, рекомпиляции и запуска, видя постепенное развитие программы и прочее. А теперь лень. . .
Мобильное приложение ColorStep
pavlinmavlin 17.09.2026
Реализовал приложение Красный, Зеленый, Синий в Unity3d + c#. Название изменил на ColorStep. Приложение прошло модерацию и теперь доступно для скачивания. Делал его сам, шаг за шагом — и вот,. . .
Запрет дублирования строк в табличной части
Maks 13.09.2026
Реализация из решения ниже выполнена на нетиповом справочнике "Нормы ТО" с табличной часть "Виды ТО", разработанного в КА2, со следующими реквизитами: - ВидТО (СправочникСсылка. ВидыТО); - ВидГСМ. . .
Скрипты Tampermonkey для CyberForum, ChatGPT, Claude и пр.
Jin X 06.09.2026
Скрипты Tampermonkey для CyberForum, ChatGPT, Claude и пр. Работая с форумом и нейросетями в браузере часто хочется что-то подкорректировать или добавить какого-то функционала. Ниже прикреплён. . .
Программа опроса у.з. расходомера SLS-720F
Argus19 02.09.2026
Программа опроса у. з. расходомера SLS-720F Программа опрашивает один раз в минуту три ультразвуковых расходомера SLS-720F через интерфейс RS-485 по протоколу Modbus RTU. Опрашиваются регистры. . .
Hyper-V: Компьютер должен поддерживать доверенный платформенный модуль 2.0.
Maks 31.08.2026
При установке Windows 11 на виртуальную машину Hyper-V 2-го поколения вылезла такая ошибка: Решение: в параметрах виртуальной машины, в разделе "Безопасность" (Security) активировать флаг. . .
Архитектура биовида Стива в Майнкрафте: Зачем бонобо кубический каннибализм
anaschu 30.08.2026
Кубический Вагинокапитализм в Minecraft: Математический инвариант ОДУ и рок Стивов-бонобо Главная задача разработанной «Модели Всего» — наглядно продемонстрировать наличие системной «судьбы». . .
КиберФорум - форум программистов, компьютерный форум, программирование
Powered by vBulletin
Copyright ©2000 - 2026, CyberForum.ru