Частотный анализ

@Muzzy2000 · Регистрация: 15.08.2017

Студворк — интернет-сервис помощи студентам

Добрый день
Возникла проблема с задачей
Условие: Дан текст. Выведите все слова, встречающиеся в тексте, по одному на каждую строку. Слова должны быть отсортированы по убыванию их количества появления в тексте, а при одинаковой частоте появления — в лексикографическом порядке.

Указание.
После того, как вы создадите словарь всех слов, вам захочется отсортироватьего по частоте встречаемости слова. Желаемого можно добиться, если создать список, элементами которого будут кортежи из двух элементов: частота встречаемости словаи само слово. Например, [(2, 'hi'), (1, 'what'), (3, 'is')]. Тогда стандартная сортировка будет сортировать список кортежей, при этом кортежи сравниваются по первому элементу, а если они равны —то по второму. Это почти то, что требуется в задаче.

Тест 1
Входные данные:

Кликните здесь для просмотра всего текста

hi
hi
what is your name
my name is bond
james bond
my name is damme
van damme
claude van damme
jean claude van damme

Вывод программы:

Кликните здесь для просмотра всего текста

damme
is
name
van
bond
claude
hi
my
james
jean
what
your

Собственно, набросал следующий код:

Python
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
inFile = open('input.txt', 'r', encoding='utf8')
n = []
for l in inFile:
   n += l.strip().split()
 
words = dict()
for w in n:
   if w in words:
      words[w] += 1
   else:
      words[w] = 0
 
MyList = list(words)
print(MyList)
i = 0
for w in words:
    i += 1
    MyList[i-1] = (words[w], w)
 
MegaList = sorted(MyList, key=lambda x: x[0], reverse=True)
print(*MegaList)

Но он сортирует вывод только по количеству упоминаний слова. Совершенно не могу понять как сделать так что бы в отсортированном списке выполнялась еще одна сортировка - уже по алфавиту - внутри каждого подмножества.

Jabbson · 15.08.2017, 19:29

Python
1
2
3
4
5
6
7
8
9
10
11
12
s = '''hi
hi
what is your name
my name is bond
james bond
my name is damme
van damme
claude van damme
jean claude van damme'''
 
lst = [word for line in s.split('\n') for word in line.split()]
print(sorted(set(lst), key=lambda x: (-lst.count(x), x)))

@Muzzy2000 · 15.08.2017, 20:07 **[ТС]**

Огромное спасибо за скорый ответ.
Но, в таком изящном виде код не проходит ограничение по времени в 1000 мс.
Test 8 Time Limit Exceeded

@Garry Galler · 15.08.2017, 23:47

Python
1
2
3
4
5
6
7
8
9
10
def word_counter():
    result = {}
    for line in open('input.txt'):
        for word in line.split():
            result[word] = result.get(word, 0) + 1  # вместо этого можно использовать setdefault или defaultdict
    # меняем местами
    result = [(v,k) for k, v in result.items()]
    # сортировка будет автоматически сначала по первому значению, затем по второму
    result = sorted(result,reverse=True) 
    print(*[t[1] for t in result],sep='\n')

P.S. Время выполнения не более 0.01 сек.

Добавлено через 3 минуты
P.S. Сортировка, впрочем, не совпадет с нужным выводом программы.

Добавлено через 52 минуты
P.P.S. Кстати, код Jabbson, делает нужную сортировку и работает также не более 0.01 сек.
Так что очень странно, что он не проходит у вас проверку по времени.

Python
1
2
3
lst = [word for line in open('input.txt') 
                            for word in line.split()]
print(*sorted(set(lst), key=lambda x: (-lst.count(x), x)),sep='\n')

@Muzzy2000 · 16.08.2017, 02:55 **[ТС]**

Да, вот я тоже получил такую сортировку, как в вашем коде. А вот как внутри каждого объединения слов по количеству упоминаний сделать еще одну обратную сортировку уже по алфавиту, вот вопрос. Код от Jabbson прекрасен, работает как надо, но сверхзадачи - выполнения тестового задания - он не может решить. Встроенная проверка слишком долго его выполняет. Спасибо за участие. Ковыряюсь дальше.

@pyuser · 16.08.2017, 04:41

Python
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
from collections import defaultdict
 
text = """
hi
hi
what is your name
my name is bond
james bond
my name is damme
van damme
claude van damme
jean claude van damme 
""".strip()
 
words = defaultdict(int)
for line in text.splitlines():
    for word in line.strip().split():
        words[word] += 1
        
frequency = defaultdict(list)
for word, freq in words.items():
    frequency[freq].append(word)
    
for freq, words in sorted(frequency.items(), key=lambda x: x[0], reverse=True):
    for word in sorted(words):
        print(word)

Рыжий Лис · 16.08.2017, 05:28

Python
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
#!/usr/bin/env python3
import re
from collections import Counter
 
t = '''\
hi
hi
what is your name
my name is bond
james bond
my name is damme
van damme
claude van damme
jean claude van damme
'''
 
words = re.findall(r'\w+', t)
d = Counter(words)
ls = [k for k, v in d.most_common()]
print('\n'.join(ls))

@Muzzy2000 · 16.08.2017, 20:51 **[ТС]**

Спасибо огромное за ваши решения. Вариант от pyuser прошел проверку на ура. Хотелось бы проверить вариант и от Рыжего Лиса. Но почему-то не получается передать из файла исходные данные туда.=(

@Pavelpds · 02.02.2019, 19:50

Еще один вариант решения:

Python
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
import sys
 
letS = (str(sys.stdin.read()).split())
myLets = {}
for let in letS:
    myLets[let] = myLets.get(let, 0) + 1
myLets = [(fr, lt) for lt, fr in myLets.items()] #menyaem mestami 
 
 
def makeSort(lws):
    return (-lws[0], lws[1])
 
 
myLets.sort(key=makeSort)
for i in range(len(myLets)):
    print(myLets[i][1])

@maaxka · 24.02.2019, 22:46

Pavelpds спасибо за твое решение, тестирующая система пропустила именно этот вариант решения

@AuditP1979 · 19.05.2019, 19:54

Павел, а можно краткое пояснение, как работает эта часть кода?
Уж очень здорово получается.

Python
1
2
def makeSort(lws):
    return (-lws[0], lws[1])

@12LOVE12 · 28.02.2021, 19:52

а как код будет выглядеть в таком случае Дан текст на языке племени Мумба-Юмба (файл 87.txt). Выведите все слова, встречающиеся в тексте, разделяя их пробелом. Слова должны быть отсортированы по убыванию их количества появления в тексте, а при одинаковой частоте появления — в алфавитном порядке

@ilstep · 09.08.2025, 14:45

Можно использовать Counter

Python
1
2
3
4
5
6
7
import sys, collections
 
Sl = collections.Counter(str(sys.stdin.read()).split())
rez = Sl.most_common()
rez.sort(key = lambda x:(-x[1], x[0]))
for z in rez:
    print(z[0])

или так

Python
1
2
3
4
import sys, collections
rez = collections.Counter(str(sys.stdin.read()).split()).most_common()
for x in sorted(rez, key = lambda x:(-x[1], x[0])):
    print(x[0])

Новые блоги и статьи Все статьи Все блоги /
Отчёт о затраченных материалах за определенный период с макетом печатной формы Maks 21.04.2026 Отчёт из решения ниже размещён в конфигурации КА2. Задача: разработка отчёта по затраченным материалам за определённый период, с возможностью вывода печатной формы отчёта с шапкой и подвалом. В. . .	Отчёт о спецтехнике находящейся в ремонте Maks 20.04.2026 Отчёт из решения ниже размещен в конфигурации КА2. Задача: отобразить спецтехнику, которая на данный момент находится в ремонте. Есть нетиповой документ "Заявка на ремонт спецтехники" который. . .	Памятка для бота и "визитка" для читателей "Semantic Universe Layer (Слой семантической вселенной)" Hrethgir 19.04.2026 Сгенерировано для краткого описания по случаю сборки и компиляции скелета серверного приложения. И пусть после этого скажут, что статьи сгенерированные AI - туфта и не интересно. И это не реклама -. . .	Запрет удаления строк ТЧ документа при определённом условии Maks 19.04.2026 Алгоритм из решения ниже реализован на примере нетипового документа "Аккумуляторы", разработанного в конфигурации КА2. У данного документа есть ТЧ, в которой в зависимости от прав доступа. . .
Модель заражения группы наркоманов alhaos 17.04.2026 Условия задачи сформулированы тут Суть: - Группа наркоманов из 10 человек. - Только один инфицирован ВИЧ. - Колются одной иглой. - Колются раз в день. - Колются последовательно через. . .	Мысли в слух. Про "навсегда". kumehtar 16.04.2026 Подумалось тут, что наверное очень глупо использовать во всяких своих установках понятие "навсегда". Это очень сильное понятие, и я только начинаю понимать край его смысла, не смотря на то что давно. . .	My Business CRM MaGz GoLd 16.04.2026 Всем привет, недавно возникла потребность создать CRM, для личных нужд. Собственно программа предоставляет из себя базу данных клиентов, в которой можно фиксировать звонки, стадии сделки, а также. . .	Знаешь почему 90% людей редко бывают счастливыми? kumehtar 14.04.2026 Потому что они ждут. Ждут выходных, ждут отпуска, ждут удачного момента. . . а удачный момент так и не приходит.

@Muzzy2000 9 / 9 / 0 Регистрация: 15.08.2017 Сообщений: 10
	15.08.2017, 20:07 [ТС]
	Огромное спасибо за скорый ответ. Но, в таком изящном виде код не проходит ограничение по времени в 1000 мс. Test 8 Time Limit Exceeded 0

@Muzzy2000 9 / 9 / 0 Регистрация: 15.08.2017 Сообщений: 10
	16.08.2017, 02:55 [ТС]
	Да, вот я тоже получил такую сортировку, как в вашем коде. А вот как внутри каждого объединения слов по количеству упоминаний сделать еще одну обратную сортировку уже по алфавиту, вот вопрос. Код от Jabbson прекрасен, работает как надо, но сверхзадачи - выполнения тестового задания - он не может решить. Встроенная проверка слишком долго его выполняет. Спасибо за участие. Ковыряюсь дальше. 0

@Muzzy2000 9 / 9 / 0 Регистрация: 15.08.2017 Сообщений: 10
	16.08.2017, 20:51 [ТС]
	Спасибо огромное за ваши решения. Вариант от pyuser прошел проверку на ура. Хотелось бы проверить вариант и от Рыжего Лиса. Но почему-то не получается передать из файла исходные данные туда.=( 1

@maaxka 2 / 2 / 0 Регистрация: 08.11.2018 Сообщений: 3
	24.02.2019, 22:46
	Pavelpds спасибо за твое решение, тестирующая система пропустила именно этот вариант решения 1

@12LOVE12 0 / 0 / 0 Регистрация: 13.11.2020 Сообщений: 26
	28.02.2021, 19:52
	а как код будет выглядеть в таком случае Дан текст на языке племени Мумба-Юмба (файл 87.txt). Выведите все слова, встречающиеся в тексте, разделяя их пробелом. Слова должны быть отсортированы по убыванию их количества появления в тексте*, а при одинаковой частоте появления — в алфавитном порядке* 0

Частотный анализ

Решение