Обработка текстовой информации 7 класс
Текст как цепочка кодов: один символ — один байт, расчёт объёма документа, текстовые редакторы, форматы и структура документа от абзаца до оглавления.
Директор школы попросила завуча распечатать список учеников на завтра, а файл на флешке оказался «кракозябрами»: вместо имён — знаки вопросов и странные буквы. Виновата не флешка и не принтер, а кодировка: файл записали в одной таблице кодов, а открыли в другой. Эта история — лучший вход в тему: текст, который мы видим как буквы, компьютер хранит как числа, и если таблица соответствий перепутана, то перепутаны и буквы. Разберёмся, как символы превращаются в байты, как сосчитать объём сочинения, не взвешивая компьютер, и почему один и тот же документ в разных форматах весит по-разному.
Компьютер умеет хранить только числа, поэтому буквы, цифры и знаки препинания договариваются записывать числами. Каждому символу присваивается код — номер в таблице, и текст превращается в цепочку номеров. Чтобы компьютеры понимали друг друга, таблицы стандартизировали: исторически один символ занимал один байт — восемь битов, что позволяло закодировать двести пятьдесят шесть разных символов. Для латиницы и цифр этого хватало, для русского и китайского пришлось изобретать многоязычные кодировки, где символ может занимать и один, и два, и четыре байта. Но принцип не меняется: текст — это числа, а числа — это биты.
Кодировочные таблицы: откуда берутся кракозябры
Кодировочная таблица — это словарь соответствий «символ — число». Если два человека пользуются разными словарями, разговор выходит странным: число семьдесят семь в одной таблице означает латинскую букву M, а в другой — русский мягкий знак или греческую букву. Именно так рождаются кракозябры: файл записан в одной таблице, а читается по другой, и каждая буква становится другим символом. Современные текстовые редакторы умеют угадывать кодировку, но угадывание — не гарантия, поэтому при обмене документами важен формат и кодировка по умолчанию, обычно многоязычная UTF-8, которая умеет записать символы практически всех языков мира.
Расчёт объёма текста — самая практичная задача темы. Если один символ занимает один байт, то объём текста равен числу символов в байтах. Считаем сочуинение: сорок строк по пятьдесят символов — две тысячи символов, две тысячи байт. Одна страница учебника — порядка трёх тысяч символов, целый школьный учебник — около миллиона, то есть один мегабайт текста. Из этой арифметики растут все задачи про дискеты, флешки и почту: сообщение в одну строку весит десятки байт, фотография — тысячи раз больше. Текст — самое лёгкое, что может хранить компьютер, и это стоит почувствовать на числах.
| Данные | Примерный объём | Что это значит на практике |
|---|---|---|
| один символ | 1 байт | восемь битов — базовая порция текста |
| строка из 50 символов | 50 байт | полсотни символов — полсотни байт |
| сочинение на 2 страницы | около 4 Кб | 2000 символов на страницу |
| учебник целиком | около 1 Мб | миллион символов текста |
Письмо занимает 2 страницы по 40 строк, в строке 50 символов, на символ — 1 байт. Сколько байт занимает текст?
Редактор: инструмент, который делает больше, чем печать
Текстовый редактор — программа для создания и правки текстовых документов, и современный редактор делает куда больше, чем хранит нажатия клавиш. Он следит за границами слов, переносит их по правилам языка, проверяет орфографию прямо во время набора, считает символы и страницы, отменяет неудачные действия и сохраняет файлы в форматах. Разница между простым и развитым редактором — как между блокнотом и издательством: первый хранит только буквы, второй управляет видом страницы, шрифтами, колонтитулами и оглавлением. Выбор инструмента зависит от задачи: записку достаточно набрать в простом редакторе, а для доклада с титульным листом нужен текстовый процессор.
Формат файла — договорённость о том, как хранить текст и его оформление. Простой текстовый формат хранит только сами символы и перевод строк: весит мало, но не умеет ни жирного шрифта, ни картинок. Форматированные форматы добавляют разметку: шрифты, отступы, таблицы, изображения — файл тяжелеет в разы. Внутри любого текстового файла лежат те же числа-коды, но вокруг них добавляются команды оформления, и их тоже нужно уметь читать программам получателей. Поэтому документ, пересланный в непопулярном формате, у адресата может открыться «криво»: программы договорились не обо всём.
Сравни весом на живом примере: записка из тысячи символов в простом формате — килобайт, а та же записка с логотипом, шрифтами и отступами в процессорном формате — десятки килобайт. Разница — плата за оформление, и она честная: в файле хранятся команды, которые рисуют вид страницы. Отсюда практический навык: выбирая формат, решай, что важнее — крошечный вес для почты или богатое оформление для печати. Отдельная хитрость — сохранение в простой текст: оно снимает всё оформление до букв и кодов, и иногда это именно то, что нужно — например, чтобы передать список без сюрпризов.
Структурирование — умение делить документ на смысловые части, и это навык не про компьютер, а про мышление. У большого документа есть иерархия: заголовок, разделы, подразделы, абзацы. Абзац — минимальная смысловая порция: одна мысль — один абзац, и это правило делает текст читаемым. Стили в процессоре — заготовки оформления для каждого уровня: задал стиль заголовка один раз — и все заголовки одинаковы, а оглавление собирается автоматически по этим стилям одним щелчком. Списки, таблицы, сноски — те же структурные элементы: каждое средство экономит читателю усилия, и в этом весь смысл оформления.
Правка — вторая половина обработки, и редактор делает её цивилизованной. Поиск находит каждое вхождение слова по всему документу за мгновение, замена исправляет опечатку в ста местах одним щелчком, а история изменений позволяет откатить неудачную правку. До компьютеров правка текста означала переписывание страницы заново — отсюда и слово «черновик». Сегодня работа с документом итеративна: набросал, поправил, переставил абзацы, выровнял заголовки — и каждая итерация стоит секунды, а не часа. Умение быстро править текст — это и есть обработка информации в прямом смысле: данные меняются, а их смысл улучшается.
Отдельный навык — перевод документа между видами. Печать — это тоже обработка: редактор переводит коды символов в точки на бумаге через драйвер принтера. Экспорт в другой формат переупаковывает содержимое: часть оформления сохраняется, часть теряется, и заранее знать, что выживет, — признак грамотного пользователя. Поиск по документу и автосохранение — те же операции над цепочками кодов, выполняемые незаметно для тебя. Каждый раз, когда редактор «что-то делает сам», под капотом работает та же арифметика символов и байтов, которую ты считаешь в задачах этой темы.
За любым удобством редактора стоит та самая арифметика кодов. Автоперенос — пересчёт позиции каждого символа; счётчик знаков — мгновенное сложение длин всех строк; поиск и замена — быстрое сравнение кодов по всему тексту. Когда понимаешь, что текст — это цепочка чисел, инструменты перестают быть магией: каждая кнопка редактора — операция над массивом кодов. Это же понимание нужно и дальше: в восьмом классе вы посчитаете объём графики и звука, а в десятом — научитесь переводить между кодировками вручную.
- Узнай, сколько символов на строку и сколько строк на страницу.
- Перемножь: символы на строку, умноженные на строки, дадут символы на страницу.
- Умножь на число страниц и получишь общее число символов.
- Умножь на размер одного символа в байтах — получишь объём документа.
- Сверь с опытом: страница текста — около трёх тысяч байт.
Объём текста равен числу , умноженному на размер одного в байтах. Кракозябры в файле — следствие несовпадения .
Банк слов
Дальше — тренажёр и тест. Считай объёмы в байтах и килобайтах, различай простой текст и форматированный, собирай структуру документа из заголовков и абзацев. За текстом в курсе следуют графика и звук — там та же логика «одна порция данных — столько-то байт», но порции крупнее. А пока проверь себя квизом и потренируй пересчёт: он понадобится на каждой контрольной по информатике, от седьмого класса до экзаменов.
Проверь себя
Клавиши 1–9 выбирают вариант, Enter — «Проверить»
1 Сколько байт занимает строка из 80 символов в однобайтовой кодировке?
2 Почему при открытии файла в другой кодировке появляются кракозябры?
3 Пробел в тексте не занимает места в памяти.
4 Что относится к структурированию документа?
5 Расположи элементы документа от большего к меньшему.
6 Сопоставь понятие и его смысл.
Нажми на элемент слева, затем на его пару справа. Повторное нажатие отменяет связь.
7 Дополни: объём текста равен произведению числа ___ на размер одного символа в ___.
Выбери подходящее слово в каждом пропуске.
Объём текста равен произведению числа на размер одного символа в .
Было понятно? Скажи — так мы видим, какие темы переписать.
Частые вопросы
Как посчитать объём текстового документа?
Умножь число символов на размер одного символа в байтах. В однобайтовой кодировке строка из 50 символов — 50 байт, страница — около 3000 байт.
Почему в файле появляются кракозябры?
Файл записан в одной кодировке, а открывается по другой таблице соответствий: те же числа-коды дают другие символы. Помогает правильный выбор кодировки при открытии.
Чем простой текст отличается от форматированного?
Простой формат хранит только символы и переводы строк, поэтому весит мало. Форматированный добавляет разметку — шрифты, отступы, картинки, — и файл тяжелеет.
Зачем нужны стили в текстовом процессоре?
Стиль задаёт оформление уровня текста один раз: все заголовки становятся одинаковыми, а оглавление собирается автоматически. Это экономит время и делает документ единообразным.